diff --git a/README.md b/README.md index 5ec9454..0542536 100644 --- a/README.md +++ b/README.md @@ -66,6 +66,31 @@ docker exec mike-ai-backup backup sudo ./smoke-test.sh ``` +### Ein oder zwei Modell-Slots + +Produktiv laufen alle Profile mit einem Slot. Damit erhält ein einzelner Chat +den vollständigen Profilkontext und die bewährte Ausgabegeschwindigkeit. Die +Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`: + +```bash +MEDIUM_PARALLEL_SLOTS=1 +``` + +Für einen späteren erneuten Paralleltest wird der Wert auf `2` gesetzt und nur +das betroffene Profil neu erstellt: + +```bash +sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env +cd /opt/mike-ai/stack +docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium +``` + +Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben Befehlen und +`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt. +Zwei Slots funktionieren direkt am Router; Hermes verwaltete zwei gleichzeitig +aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der Standard, +bis Hermes' Sitzungsfehler behoben ist. + Router-API: `http://:8081/v1` Hermes-Dashboard: `http://:9119`