Document unified Medium slots and dashboard capacity

This commit is contained in:
Mikei386 committed 2026-09-20 18:52:07 +02:00
1 parent 9af719674b
commit 53320fa6c3
9 files changed
+94 -57

No files matched your search

+18 -13
View File
@@ -1,6 +1,6 @@
# Athena AI
Stand: **16. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
Stand: **20. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
**llama.cpp 0.4.1** (`b29c606`).
Der [geprüfte Live-Stand](docs/LIVE_STATE.md) beschreibt Profile, GPUs und die
Abweichung zwischen dem bereitgestellten Stack und dem Git-Checkout.
@@ -95,28 +95,33 @@ von llama.cpp übersteuern würde. Clients, die direkt
### Ein oder zwei Modell-Slots
Produktiv laufen alle Profile mit einem Slot. Damit erhält ein einzelner Chat
den vollständigen Profilkontext und die bewährte Ausgabegeschwindigkeit. Die
Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
Fast, Large, Ultra und Uncensored laufen mit einem Slot. Medium läuft seit dem
19. September in einem kontrollierten OpenClaw-Praxistest mit zwei Slots. Beide
Medium-Slots teilen sich durch `--kv-unified` **einen** 160.000-Token-KV-Pool;
es entstehen keine zwei unabhängigen 160K-Kontextfenster. Belegt ein Slot
beispielsweise 30.000 Token, stehen dem zweiten höchstens noch etwa 130.000
Token aus diesem Pool zur Verfügung. Das Dashboard zeigt diese aktuell
erreichbare Kapazität und den freien gemeinsamen Pool dynamisch an.
Die Live-Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
```bash
MEDIUM_PARALLEL_SLOTS=1
MEDIUM_PARALLEL_SLOTS=2
```
Für einen späteren erneuten Paralleltest genügt es, den Wert auf `2` zu setzen
und ausschließlich das aktuell betroffene Profil neu zu erstellen:
Zum Umschalten wird nur Medium neu erstellt:
```bash
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=1/' /etc/mike-ai/stack.env
cd /opt/mike-ai/stack
docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium
```
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben zwei Befehlen und
`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt.
Zwei Slots wurden direkt am Router erfolgreich getestet; Hermes verwaltete zwei
gleichzeitig aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der
Standard, bis Hermes' Sitzungsfehler behoben ist.
Für zwei Slots wird im ersten Befehl wieder `2` gesetzt. Der Compose- und
Installationsstandard bleibt bewusst `1`; damit wird der Versuchsstand bei
einer Neuinstallation nicht unbemerkt zur Vorgabe. Der aktuelle Live-Test mit
OpenClaw kann zwei gleichzeitige Anforderungen annehmen. Sehr große parallele
Prefills konkurrieren weiterhin um Rechenleistung und den gemeinsamen KV-Pool.
## Endpunkte