Document unified Medium slots and dashboard capacity
This commit is contained in:
1 parent
9af719674b
commit
53320fa6c3
9 files changed
+94
-57
No files matched your search
@@ -1,6 +1,6 @@
|
||||
# Athena AI
|
||||
|
||||
Stand: **16. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
|
||||
Stand: **20. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
|
||||
**llama.cpp 0.4.1** (`b29c606`).
|
||||
Der [geprüfte Live-Stand](docs/LIVE_STATE.md) beschreibt Profile, GPUs und die
|
||||
Abweichung zwischen dem bereitgestellten Stack und dem Git-Checkout.
|
||||
@@ -95,28 +95,33 @@ von llama.cpp übersteuern würde. Clients, die direkt
|
||||
|
||||
### Ein oder zwei Modell-Slots
|
||||
|
||||
Produktiv laufen alle Profile mit einem Slot. Damit erhält ein einzelner Chat
|
||||
den vollständigen Profilkontext und die bewährte Ausgabegeschwindigkeit. Die
|
||||
Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
|
||||
Fast, Large, Ultra und Uncensored laufen mit einem Slot. Medium läuft seit dem
|
||||
19. September in einem kontrollierten OpenClaw-Praxistest mit zwei Slots. Beide
|
||||
Medium-Slots teilen sich durch `--kv-unified` **einen** 160.000-Token-KV-Pool;
|
||||
es entstehen keine zwei unabhängigen 160K-Kontextfenster. Belegt ein Slot
|
||||
beispielsweise 30.000 Token, stehen dem zweiten höchstens noch etwa 130.000
|
||||
Token aus diesem Pool zur Verfügung. Das Dashboard zeigt diese aktuell
|
||||
erreichbare Kapazität und den freien gemeinsamen Pool dynamisch an.
|
||||
|
||||
Die Live-Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
|
||||
|
||||
```bash
|
||||
MEDIUM_PARALLEL_SLOTS=1
|
||||
MEDIUM_PARALLEL_SLOTS=2
|
||||
```
|
||||
|
||||
Für einen späteren erneuten Paralleltest genügt es, den Wert auf `2` zu setzen
|
||||
und ausschließlich das aktuell betroffene Profil neu zu erstellen:
|
||||
Zum Umschalten wird nur Medium neu erstellt:
|
||||
|
||||
```bash
|
||||
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env
|
||||
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=1/' /etc/mike-ai/stack.env
|
||||
cd /opt/mike-ai/stack
|
||||
docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium
|
||||
```
|
||||
|
||||
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben zwei Befehlen und
|
||||
`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt.
|
||||
Zwei Slots wurden direkt am Router erfolgreich getestet; Hermes verwaltete zwei
|
||||
gleichzeitig aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der
|
||||
Standard, bis Hermes' Sitzungsfehler behoben ist.
|
||||
Für zwei Slots wird im ersten Befehl wieder `2` gesetzt. Der Compose- und
|
||||
Installationsstandard bleibt bewusst `1`; damit wird der Versuchsstand bei
|
||||
einer Neuinstallation nicht unbemerkt zur Vorgabe. Der aktuelle Live-Test mit
|
||||
OpenClaw kann zwei gleichzeitige Anforderungen annehmen. Sehr große parallele
|
||||
Prefills konkurrieren weiterhin um Rechenleistung und den gemeinsamen KV-Pool.
|
||||
|
||||
## Endpunkte
|
||||
|
||||
|
||||
Reference in new issue
Block a user