Default Athena profiles to one inference slot

This commit is contained in:
Mikei386
2026-08-30 22:11:55 +02:00
parent 014583e7f6
commit 8be1cd6a6f
4 changed files with 9 additions and 11 deletions
+6 -8
View File
@@ -68,8 +68,8 @@ Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
MEDIUM_PARALLEL_SLOTS=1
```
Für einen späteren erneuten Paralleltest wird der Wert auf `2` gesetzt und nur
das betroffene Profil neu erstellt:
Für einen späteren erneuten Paralleltest genügt es, den Wert auf `2` zu setzen
und ausschließlich das aktuell betroffene Profil neu zu erstellen:
```bash
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env
@@ -77,13 +77,11 @@ cd /opt/mike-ai/stack
docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium
```
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben Befehlen und
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben zwei Befehlen und
`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt.
Zwei Slots funktionieren direkt am Router; Hermes verwaltete zwei gleichzeitig
aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der Standard,
bis Hermes' Sitzungsfehler behoben ist.
Router-API: `http://<WireGuard-IP>:8081/v1`
Zwei Slots wurden direkt am Router erfolgreich getestet; Hermes verwaltete zwei
gleichzeitig aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der
Standard, bis Hermes' Sitzungsfehler behoben ist.
## Endpunkte