Document Athena slot toggle
This commit is contained in:
@@ -66,6 +66,31 @@ docker exec mike-ai-backup backup
|
||||
sudo ./smoke-test.sh
|
||||
```
|
||||
|
||||
### Ein oder zwei Modell-Slots
|
||||
|
||||
Produktiv laufen alle Profile mit einem Slot. Damit erhält ein einzelner Chat
|
||||
den vollständigen Profilkontext und die bewährte Ausgabegeschwindigkeit. Die
|
||||
Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
|
||||
|
||||
```bash
|
||||
MEDIUM_PARALLEL_SLOTS=1
|
||||
```
|
||||
|
||||
Für einen späteren erneuten Paralleltest wird der Wert auf `2` gesetzt und nur
|
||||
das betroffene Profil neu erstellt:
|
||||
|
||||
```bash
|
||||
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env
|
||||
cd /opt/mike-ai/stack
|
||||
docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium
|
||||
```
|
||||
|
||||
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben Befehlen und
|
||||
`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt.
|
||||
Zwei Slots funktionieren direkt am Router; Hermes verwaltete zwei gleichzeitig
|
||||
aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der Standard,
|
||||
bis Hermes' Sitzungsfehler behoben ist.
|
||||
|
||||
Router-API: `http://<WireGuard-IP>:8081/v1`
|
||||
|
||||
Hermes-Dashboard: `http://<Unraid-IP>:9119`
|
||||
|
||||
Reference in New Issue
Block a user