Document unified Medium slots and dashboard capacity

This commit is contained in:
Mikei386
2026-09-20 18:52:07 +02:00
parent 9af719674b
commit 53320fa6c3
9 changed files with 94 additions and 57 deletions
+1 -1
View File
@@ -32,7 +32,7 @@ flowchart LR
K[Backup alle 5 Stunden] --> DATA[/data und /etc/mike-ai]
```
Stand: 16. September 2026. Versionen und Abweichungen: [Live-Stand](LIVE_STATE.md).
Stand: 20. September 2026. Versionen und Abweichungen: [Live-Stand](LIVE_STATE.md).
FLUX nutzt beide GPUs und pausiert dafür LLM und Qwen3-TTS. Dashboard und
Portainer besitzen eigene Netzwerk-Namespaces in `mike-ai_frontend`; der Router
läuft in `mike-ai_control`. Der Gateway vermittelt den privaten Zugriff.
+11 -9
View File
@@ -1,8 +1,8 @@
# Container-Inventar auf Athena
Stand: 16. September 2026 (lesender Docker-Abgleich)
Stand: 20. September 2026 (lesender Docker-Abgleich)
Athena hatte beim lesenden Abgleich 27 Docker-Container. Nicht jeder Container enthält
Athena hatte beim lesenden Abgleich 30 Docker-Container. Nicht jeder Container enthält
ein KI-Modell: Router, Oberflächen, Netzwerk, Steuerung und Sicherung sind
gewöhnliche Dienste. Die rechenintensiven GPU-Worker werden absichtlich nur bei
Bedarf gestartet. Ein Container im Zustand `Created` oder `Exited (0)` ist daher
@@ -11,20 +11,23 @@ nicht automatisch ein ungenutzter Rest.
| Container | Modell oder wesentliche Komponente | Aufgabe |
|---|---|---|
| `mike-ai-backup` | kein Modell; Offen Docker Volume Backup `v2` (Digest vom 15. September 2026) | Sichert `/data`, `/etc/mike-ai`, den Stack und die persistenten Docker-Volumes im Fünf-Stunden-Takt. |
| `mike-ai-bonsai2-ab` | Bonsai-2-Vergleichsmodell | Gestoppter, reproduzierbar dokumentierter A/B-Testcontainer; kein Produktivprofil. |
| `mike-ai-applio-studio` | Applio/RVC; Stimmenmodelle werden nutzerseitig ergänzt | Vollständige RVC-Oberfläche für Inferenz, Modellverwaltung und Training auf der RTX 5080. Für eine Konvertierung ist ein importiertes oder trainiertes `.pth`-Modell nötig; eine Referenzaufnahme allein reicht nicht. |
| `mike-ai-image-worker` | FLUX.2 Klein 9B FP8, Qwen3-8B NF4 Textencoder und VAE | Erzeugt und bearbeitet Bilder transaktional; nutzt während eines Auftrags RTX 5080 und RTX 3060. |
| `mike-ai-llama-dashboard` | kein Modell | Zeigt Telemetrie, Profile, GPU-Nutzung, Slot-Kontextbelegung mit Verlauf und Betriebsarten an und bietet die Modusumschaltung. |
| `mike-ai-llama-fast` | Qwen3.8-27B `IQ4-MIX`, Qwen-MMProj BF16 | Schnelles Q4-Text-/Vision-Profil mit 76.800 Token Kontext. |
| `mike-ai-llama-large` | Qwen3.8-27B `IQ4_XS-pure`, Qwen-MMProj BF16 | Q4-Text-/Vision-Profil mit 192.000 Token Kontext und Verteilung auf beide GPUs. |
| `mike-ai-llama-medium` | Qwen3.8-27B `IQ4_XS-pure`, Qwen-MMProj BF16 | Standard-Q4-Text-/Vision-Profil mit 160.000 Token Kontext und Verteilung auf beide GPUs. |
| `mike-ai-llama-medium` | Qwen3.8-27B `IQ4_XS-pure`, Qwen-MMProj BF16 | Standard-Q4-Text-/Vision-Profil mit gemeinsamem 160.000-Token-KV-Pool, aktuell zwei Slots und Verteilung auf beide GPUs. |
| `mike-ai-llama-ultra` | Qwen3.8-27B `IQ4_XS-pure`, ohne Vision-Projektor | Maximales Langkontextprofil mit 262.144 Token Kontext und Verteilung auf beide GPUs. |
| `mike-ai-llama-uncensored` | Qwen3.8-27B Abliterated `Q4_K_M`, eigener MMProj F16 | Spezialprofil mit 80.000 Token Kontext und gelockerten Modellgrenzen. |
| `mike-ai-ltx2-studio` | LTX-Video-Backend | GPU-Worker für lokale Videogenerierung; beim Abgleich gestoppt. |
| `mike-ai-mcp-athena-operator` | kein Modell | Stellt Hermes begrenzte Werkzeuge zum Prüfen, Ändern, Testen, Sichern und Versionieren von Athena bereit. |
| `mike-ai-music-acestep-test` | ACE-Step 1.5 XL-SFT und `acestep-5Hz-lm-1.7B` | Generiert Musik im exklusiven Musikmodus auf der RTX 5080. |
| `mike-ai-music-ui` | kein Modell; `fspecii/ace-step-ui` | Community-Oberfläche für ACE-Step; bleibt als leichte UI verfügbar, während der GPU-Worker bedarfsgesteuert läuft. |
| `mike-ai-ornith15-ab` | Ornith 1.5 35B-A3B | Gestoppter, reproduzierbar dokumentierter A/B-Testcontainer; kein Produktivprofil. |
| `mike-ai-portainer` | kein Modell; Portainer CE | Optionale Docker-Verwaltungsoberfläche. |
| `mike-ai-profile-controller` | kein Modell | Startet und stoppt ausschließlich freigegebene Modellprofile und Spezialworker in einer sicheren Reihenfolge. |
| `mike-ai-qwen-cron-test` | kleines Qwen-Testmodell | Gestoppter CPU-/Cron-Worker-Versuch; nicht produktiv eingesetzt. |
| `mike-ai-realtime-voice` | kein Modell | Laufende, gesunde WebRTC-Brücke für OpenClaw Talk; verbindet über den privaten WireGuard-Pfad Athena Whisper, OpenClaw-Agent und Qwen3-TTS ohne Profilwechsel. |
| `mike-ai-qwen3-tts` | `Qwen/Qwen3-TTS-12Hz-1.7B-Base`, Stimme Serena | Hochwertige deutsche Sprachausgabe auf der RTX 3060 im LLM-Betrieb. |
| `mike-ai-router` | kein eigenes Modell | Einzige OpenAI-kompatible Modelladresse; koordiniert Profile, Bildaufträge, Sprache und Betriebsarten. |
@@ -38,12 +41,11 @@ nicht automatisch ein ungenutzter Rest.
| `mike-ai-trellis-studio` | Image `mike-ai/trellis-studio:0.6.0-q8` | Vorhandener, gestoppter 3D-Worker; in diesem Abgleich nicht funktional getestet. |
| `mike-ai-mikes-applio-ui` | Image `mike-ai/mikes-applio-ui:latest` | Laufende zusätzliche Applio-Oberfläche. |
Alle fünf llama-Container verwenden llama.cpp 0.4.1 (`b29c606`). Medium
lief beim ersten Abgleich, war später aber mit Exit-Code 139 beendet; die
anderen vier waren nicht aktiv. Dieser Laufzeitfehler wurde im Zuge der
Dokumentationsarbeit nicht behoben. Der Image-Worker war ebenfalls gestoppt.
Die Infrastruktur und die Musik-/Applio-Oberflächen liefen. Diese Zustände
ändern sich mit der Nutzung.
Alle fünf llama-Container verwenden llama.cpp 0.4.1 (`b29c606`). Medium lief
beim Abgleich gesund mit zwei Slots; die anderen vier Textprofile waren
planmäßig nicht aktiv. Der Image-Worker war ebenfalls gestoppt. Die
Infrastruktur und die Musik-/Applio-Oberflächen liefen. Diese Zustände ändern
sich mit der Nutzung.
Die Detailbeschreibungen der Spezialmodelle stammen aus der bestehenden
Betriebsdokumentation; dieses Update prüfte deren Containerbestand, nicht
sämtliche Modellgewichte oder Funktionen neu.
+6 -1
View File
@@ -1,12 +1,17 @@
# Aktuelle Laufzeitnotizen
Stand: 15. September 2026.
Stand: 20. September 2026.
Der verbindliche Abgleich steht im [geprüften Live-Stand](LIVE_STATE.md).
Produktiv läuft **llama.cpp 0.4.1** auf Commit `b29c606`, zuvor b10930.
Alle fünf installierten Profile verwenden dasselbe CUDA-Image. Die Startoption
bleibt `--load-mode none`.
Medium läuft im aktuellen OpenClaw-Praxistest mit zwei Slots. `--kv-unified`
teilt den 160.000-Token-KV-Pool dynamisch zwischen beiden Slots; das Dashboard
zeigt je Slot die aktuell noch erreichbare Kapazität. Alle anderen Profile und
der Installationsstandard bleiben bei einem Slot.
[B10930-Updatebericht](LLAMA_B10930_UPDATE_20260912.md): Version, Image-ID,
Funktionsproben, Vergleichsmessungen und gesicherter Rückfallstand.
+27 -24
View File
@@ -1,6 +1,6 @@
# Geprüfter Live-Stand auf Athena
Stand: **16. September 2026**. Quelle: lesender SSH-Abgleich von Docker,
Stand: **20. September 2026**. Quelle: lesender SSH-Abgleich von Docker,
Compose-Dateien, Git-Inhalten, Images, Health-Endpunkten und Backup-Timern.
Containerzustände sind Momentaufnahmen; der Controller darf Profile danach
umschalten. Es wurde für diesen Abgleich kein Dienst neu gestartet.
@@ -9,28 +9,30 @@ umschalten. Es wurde für diesen Abgleich kein Dienst neu gestartet.
Athena: Debian 13, RTX 5080 (16 GB) und RTX 3060 (12 GB). Die fünf
Textprofil-Images tragen alle `com.mike-ai.llama-cpp-commit=b29c606`
(llama.cpp 0.4.1). Sie verwenden `--load-mode none`, `--parallel 1` und
`--batch-size 2048`. Die `ubatch-size` wurde pro Profil auf einen getesteten
Wert gesetzt; sie ist **nicht** überall identisch.
(llama.cpp 0.4.1). Sie verwenden `--load-mode none` und `--batch-size 2048`.
Fast, Large, Ultra und Uncensored verwenden einen Slot. Medium läuft seit dem
19. September kontrolliert mit `--parallel 2` und `--kv-unified`. Seine beiden
Slots teilen sich den einzigen 160.000-Token-KV-Pool. Die `ubatch-size` wurde
pro Profil auf einen getesteten Wert gesetzt; sie ist **nicht** überall
identisch.
| Profil | Qwen3.8-27B-Variante | Kontext | Tensor-Split 5080:3060 | Vision-Projektor | MTP Draft | ubatch |
|---|---|---:|---|---|---:|---:|
| Fast | IQ4-MIX | 76.800 | nur 5080 | 3060 | 2 | 64 |
| Medium | IQ4_XS Pure | 160.000 | 85:15 | 3060 | 3 | 512 |
| Large | IQ4_XS Pure | 192.000 | 86:14 | 3060 | 3 | 256 |
| Ultra | IQ4_XS Pure | 262.144 | 80:20 | keiner | 2 | 128 |
| Uncensored | Abliterated Q4_K_M | 80.000 | 90:10 | 3060 | 2 | 256 |
| Profil | Qwen3.8-27B-Variante | Kontext | Slots | Tensor-Split 5080:3060 | Vision-Projektor | MTP Draft | ubatch |
|---|---|---:|---:|---|---|---:|---:|
| Fast | IQ4-MIX | 76.800 | 1 | nur 5080 | 3060 | 2 | 64 |
| Medium | IQ4_XS Pure | 160.000 gemeinsam | 2 | 85:15 | 3060 | 3 | 512 |
| Large | IQ4_XS Pure | 192.000 | 1 | 86:14 | 3060 | 3 | 256 |
| Ultra | IQ4_XS Pure | 262.144 | 1 | 80:20 | keiner | 2 | 128 |
| Uncensored | Abliterated Q4_K_M | 80.000 | 1 | 90:10 | 3060 | 2 | 256 |
Tensor-Splits sind Startparameter, keine gemessenen VRAM-Anteile. Der
Vision-Projektor liegt bei den vier Vision-Profilen auf GPU 1 (3060).
`beta1` steht in der Repository-Matrix, ist aber nicht installiert. Der
Router bietet nur die fünf installierten Profile an. Beim ersten Abgleich
war Medium aktiv und der Router im LLM-Modus; beim späteren Containerabgleich
war `mike-ai-llama-medium` mit Exit-Code 139 beendet. Das Log endet mit
einem CUDA-Stacktrace im Vision-/CLIP-Encoding (`libmtmd`/`libggml-cuda`);
eine eindeutige Ursache wurde nicht ermittelt. Dieser Laufzeitfehler wurde
bei der Dokumentationsarbeit nicht behoben oder durch einen Neustart
verdeckt. Der aktuelle Zustand ist über Dashboard/Controller zu prüfen.
Router bietet nur die fünf installierten Profile an. Beim Abgleich am
20. September lief Medium seit rund 21 Stunden gesund mit zwei Slots; die vier
anderen Textprofile waren planmäßig gestoppt. Dashboard, Router, Controller,
Whisper, TTS und Realtime-Voice waren ebenfalls gesund. Der frühere
Vision-/CLIP-Absturz ist als historischer Befund erhalten, beschreibt aber
nicht mehr den aktuellen Containerzustand.
## Weitere Dienste
@@ -54,17 +56,18 @@ verdeckt. Der aktuelle Zustand ist über Dashboard/Controller zu prüfen.
trotzdem Status, Modelle und vorbereitende Aufgaben anzeigen; eine echte
Konvertierung verlangt den Applio-Modus.
Der vollständige Bestand der **27** angelegten Docker-Container steht im
Der vollständige Bestand der **30** angelegten Docker-Container steht im
[Container-Inventar](CONTAINER_INVENTORY.md). `Created` oder `Exited` bei
Spezialworkern bedeutet nicht automatisch einen zu entfernenden Testrest.
## Git und reproduzierbarer Stand
Der laufende Stack liegt unter `/opt/mike-ai/stack`. Sein Git-HEAD war
`276df0e` und damit älter als der aktuelle Git-Stand; `compose.yaml` und
`services/athena-realtime-voice/` sind im Live-Checkout nicht committed.
**Die geprüften Nutzdaten dieser Dateien stimmen aber bytegenau mit dem
neueren Git-Stand überein.** Ein frischer Clone liefert damit den Quellcode
Der laufende Stack liegt unter `/opt/mike-ai/stack`. Sein Git-HEAD ist weiterhin
`276df0e` und damit älter als Doggo; `compose.yaml`, Dashboard und
`services/athena-realtime-voice/` liegen dort als Live-Änderungen. Die am
20. September geprüften Hashes von Compose, Dashboard, Dashboard-Test und
Voice-Bridge stimmen bytegenau mit diesem veröffentlichten Repository-Stand
überein. Ein frischer Clone liefert damit den Quellcode
und die Compose-Definitionen; er liefert weder lokale Secrets noch
Modellgewichte oder persistente Nutzerdaten. Vor einem Deploy ist die
Live-Konfiguration zu sichern und mit dem Checkout abzugleichen, statt den
+6 -4
View File
@@ -23,10 +23,12 @@ The larger logical batches 3072 and 4096 did not improve Medium at ubatch 128. T
## Historischer Medium-Zwei-Slot-Test
This was an A/B candidate, not the current production configuration. Production
was returned to **one slot** because concurrent Hermes requests did not behave
reliably enough. The 85:15 GPU split and batch / ubatch 2048 / 128 remain in
production because they also work with the single-slot profile.
This began as an A/B candidate and was initially returned to **one slot**
because concurrent Hermes requests did not behave reliably enough. On
19 September 2026, Medium was enabled again with two unified-KV slots for a
controlled OpenClaw live trial. The figures below remain the historical
benchmark rather than a new performance claim. The current Medium ubatch is
512; the 85:15 GPU split is unchanged.
Identical fresh 100,297-token prompt with a deterministic 256-token completion: