Files
AI-Profile-Router/docs/LIVE_STATE.md
T

135 lines
8.1 KiB
Markdown

# Geprüfter Live-Stand auf Athena
Nachtrag vom 25. September 2026: Die produktive Spracherkennung läuft über
Qwen3-ASR 0.6B Q8 auf der CPU (`mike-ai-qwen-asr` und
`mike-ai-qwen-asr-worker`). Der Router bietet nur `qwen3-asr` als STT-Modell
an; OpenClaw und die Voice-Brücke verwenden denselben Namen. Eine M4A-Aufnahme
wurde über `/v1/audio/transcriptions` geprüft. Whisper-Container,
Images und Modellvolume wurden entfernt. Das aktive Ultra-Profil wurde bei
dieser Umstellung nicht gewechselt. Die Angaben zu Whisper weiter unten
beschreiben den historischen Stand vom 21. September.
Nachtrag vom 24. September 2026: Ultra verarbeitet nun Bilder mit einem
CPU-seitigen BF16-Vision-Projektor. Der Stand und der Funktionstest sind in
[Ultra-Vision mit CPU-Projektor](ULTRA_CPU_VISION_20260924.md) dokumentiert.
Die folgende Tabelle bildet weiterhin den historischen Stand vom 21. September ab.
Stand: **21. September 2026**. Quelle: lesender SSH-Abgleich von Docker,
Compose-Dateien, Git-Inhalten, Images, Health-Endpunkten und Backup-Timern.
Containerzustände sind Momentaufnahmen; der Controller darf Profile danach
umschalten. Für die Prompt-Enhancer-Integration wurden Router und Controller
gezielt neu gebaut und beide Bildpfade transaktional geprüft.
Aktueller Abschluss: [Test- und Änderungsübersicht](ATHENA_SESSION_20260920.md).
Die folgenden MTP-/Microbatch-Werte enthalten die abschließenden Übernahmen.
## Laufzeit und Profile
Athena: Debian 13, RTX 5080 (16 GB) und RTX 3060 (12 GB). Die fünf
Textprofil-Images tragen alle `com.mike-ai.llama-cpp-commit=b29c606`
(llama.cpp 0.4.1). Sie verwenden `--load-mode none` und `--batch-size 2048`.
Fast, Large, Ultra und Uncensored verwenden einen Slot. Medium läuft seit dem
19. September kontrolliert mit `--parallel 2` und `--kv-unified`. Seine beiden
Slots teilen sich den einzigen 160.000-Token-KV-Pool. Die `ubatch-size` wurde
pro Profil auf einen getesteten Wert gesetzt; sie ist **nicht** überall
identisch.
| Profil | Qwen3.8-27B-Variante | Kontext | Slots | Tensor-Split 5080:3060 | Vision-Projektor | MTP Draft | ubatch |
|---|---|---:|---:|---|---|---:|---:|
| Fast | IQ4-MIX | 76.800 | 1 | nur 5080 | 3060 | 2 | 64 |
| Medium | IQ4_XS Pure | 160.000 gemeinsam | 2 | 85:15 | 3060 | 2 | 256 |
| Large | IQ4_XS Pure | 192.000 | 1 | 86:14 | 3060 | 2 | 256 |
| Ultra | IQ4_XS Pure | 262.144 | 1 | 80:20 | keiner | 2 | 128 |
| Uncensored | Abliterated Q4_K_M | 80.000 | 1 | 90:10 | 3060 | 2 | 256 |
Tensor-Splits sind Startparameter, keine gemessenen VRAM-Anteile. Der
Vision-Projektor liegt bei den vier Vision-Profilen auf GPU 1 (3060).
Der Router bietet die fünf installierten Profile an. Beim abschließenden
Abgleich am 20. September lief Medium gesund mit MTP2, Microbatch256 und zwei
Slots. Large ist mit MTP2 neu angelegt und startet beim nächsten Profilwechsel;
die anderen Profile sind planmäßig gestoppt. Dashboard, Router, Controller,
Whisper, TTS und Realtime-Voice waren ebenfalls gesund. Der frühere
Vision-/CLIP-Absturz ist als historischer Befund erhalten, beschreibt aber
nicht mehr den aktuellen Containerzustand.
## Weitere Dienste
- Qwen-Image-2.1 INT8 läuft produktiv über gepinntes ComfyUI mit Low-VRAM auf
der RTX 5080. Der Router verwendet 25 Schritte, Guidance 1 und bis zu vier
Referenzbilder. Vor jedem Bild startet er automatisch den passenden
offiziellen Q5-Prompt-Enhancer: PE-T2I für reine Textaufträge oder PE-I2I
für Referenzbilder. Der Enhancer läuft kurzzeitig auf der RTX 3060, wird vor
dem Rendern wieder gestoppt und speichert Rohprompt sowie Rewrite im
Bild-Sidecar. FLUX.2 Klein 9B FP8 bleibt mit seinen Gewichten als
gestoppter, explizit allowlist-beschränkter Rückfallcontainer erhalten.
- Qwen3-TTS 1.7B auf 3060 hinter dem TTS-Gateway; kein Piper-Fallback.
- Whisper.cpp `ggml-small` auf CPU über `/v1/audio/transcriptions`.
- `mike-ai-embedding` stellt EmbeddingGemma 300M Q8 CPU-only über den privaten
WireGuard-Endpunkt `http://192.168.1.212:8082/v1/embeddings` bereit. Eine
Probe mit zwei deutschen Texten lieferte zwei Vektoren mit je 768 Dimensionen.
Gemessen wurden rund 86 MiB RAM im Leerlauf, rund 1,1 GiB beim vollständigen
Indexaufbau und 0,044 Sekunden für die abschließende Netzwerkprobe. OpenClaw
indexierte 107 Dateien mit 1.139 Chunks vollständig; die semantische Suche
und der 768-dimensionale Vektorindex sind aktiv. Der
GPU-Versuch war zwar schneller (0,077 Sekunden), ließ im Ultra-Profil aber
nur 372 MB VRAM auf der RTX 3060 frei und wurde deshalb verworfen.
- Der gesunde Dienst `mike-ai-realtime-voice` vermittelt OpenClaw Talk über
WebRTC zwischen Whisper, dem normalen OpenClaw-Agenten und Qwen3-TTS.
Er braucht keine GPU und keinen Profilwechsel. Das Plugin liegt in
`integrations/openclaw-athena-talk` und läuft auf Unraid, nicht auf Athena.
Diktat und hochgeladene M4A-Sprachnachrichten nutzen den separaten
Transkriptionspfad des Plugins. Plugin 1.3.0 zerlegt längere Browser-Diktate
während der Aufnahme in überlappende Sechs-Sekunden-Abschnitte und hält so
den Abschluss innerhalb von OpenClaws festem Fünf-Sekunden-Fenster. OpenClaw
selbst wurde dafür nicht gepatcht. Die lokale Sicherheitsgrenze
`maxSpeechSeconds` steht produktiv auf 180 Sekunden. OpenClaw liefert den
fertigen Agententext
an die Brücke; das Sprechen beginnt daher erst nach Abschluss der
Agentenantwort. Details und Grenzen stehen in der [Voice-Doku](../services/athena-realtime-voice/README.md).
- `mike-ai-mikes-applio-ui` läuft gesund und ohne GPU. Die Quelle liegt im
eigenen Repository [Mikes-Applio-UI](https://git.casaderoll.de/michael/Mikes-applio-ui).
Der Applio-GPU-Container war beim Abgleich nicht gestartet. Die UI kann
trotzdem Status, Modelle und vorbereitende Aufgaben anzeigen; eine echte
Konvertierung verlangt den Applio-Modus.
Der vollständige Bestand der **33** angelegten Docker-Container steht im
[Container-Inventar](CONTAINER_INVENTORY.md). `Created` oder `Exited` bei
Spezialworkern bedeutet nicht automatisch einen zu entfernenden Testrest.
## Git und reproduzierbarer Stand
Der laufende Stack liegt unter `/opt/mike-ai/stack`. Beim Router-Audit am
20. September wurde er auf den veröffentlichten Quellstand synchronisiert.
Die Funktionsänderungen sind in Commit `6071b1a` enthalten; anschließende
Dokumentationskorrekturen ändern keine Container. Die früheren Live-Anpassungen
an Compose, Dashboard und Voice-Bridge wurden bytegenau verglichen und in einem
lokalen Sicherungscommit erhalten. Controller und Router wurden gezielt ersetzt;
Zum damaligen Router-Audit behielten Medium und Gateway ihre Startzeiten.
Die späteren Modelltests und die Medium-Übernahme starteten Medium mehrfach neu;
der Gateway blieb unverändert. Die späteren Commits sind in der Abschlussübersicht verzeichnet.
Messwerte, Prüfungen und Rückfallstand stehen im
[Router-Audit](ROUTER_AUDIT_20260920.md).
Ein frischer Clone enthält Quellcode und Compose-Definitionen, aber keine
lokalen Secrets, Modellgewichte oder persistenten Nutzerdaten. Lokale
Konfiguration vor jedem Deploy sichern; keinen laufenden Host blind zurücksetzen.
Die Applio-UI hat einen eigenen Checkout `/opt/mike-ai/Mikes-Applio-UI`.
Sein Git-HEAD `3a06139` ist älter als Doggo `eadbc15`. Die laufende
Anwendungsquelle stimmt bis auf Versionsmetadaten und den später
korrigierten Dokumentationsstand mit Doggo überein. Siehe
[Applio-Integrationsdoku](https://git.casaderoll.de/michael/Mikes-applio-ui/src/branch/main/docs/ATHENA-INTEGRATION.md).
## Backup und Prüfumfang
`mike-ai-backup` lief; der jüngste geprüfte manuelle Archivlauf schloss
Compose und Voice-Bridge ein. Der Fünf-Stunden-Export-Timer war aktiv, der
externe Restic-Timer zwar ebenfalls aktiviert, aber ohne seine erforderliche
`/etc/mike-ai/disaster-backup.env` **nicht** als funktionierende externe
Sicherung zu werten. Details und Restore-Grenzen: [Backup](RECOVERY.md).
Geprüft wurden aktuelle Container- und Quellenstände, Health-Endpunkte sowie
Text-zu-Bild und Referenzbildbearbeitung mit den beiden Prompt-Enhancern. Keine
erneuten Langkontext-, Trainings- oder Restore-Tests; ältere Ergebnisse sind im [Update-Audit](UPDATE_AUDIT_20260915.md)
und [FLUX-Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md) dokumentiert.