119 lines
7.2 KiB
Markdown
119 lines
7.2 KiB
Markdown
# Geprüfter Live-Stand auf Athena
|
|
|
|
Stand: **21. September 2026**. Quelle: lesender SSH-Abgleich von Docker,
|
|
Compose-Dateien, Git-Inhalten, Images, Health-Endpunkten und Backup-Timern.
|
|
Containerzustände sind Momentaufnahmen; der Controller darf Profile danach
|
|
umschalten. Für die Prompt-Enhancer-Integration wurden Router und Controller
|
|
gezielt neu gebaut und beide Bildpfade transaktional geprüft.
|
|
|
|
Aktueller Abschluss: [Test- und Änderungsübersicht](ATHENA_SESSION_20260920.md).
|
|
Die folgenden MTP-/Microbatch-Werte enthalten die abschließenden Übernahmen.
|
|
|
|
## Laufzeit und Profile
|
|
|
|
Athena: Debian 13, RTX 5080 (16 GB) und RTX 3060 (12 GB). Die fünf
|
|
Textprofil-Images tragen alle `com.mike-ai.llama-cpp-commit=b29c606`
|
|
(llama.cpp 0.4.1). Sie verwenden `--load-mode none` und `--batch-size 2048`.
|
|
Fast, Large, Ultra und Uncensored verwenden einen Slot. Medium läuft seit dem
|
|
19. September kontrolliert mit `--parallel 2` und `--kv-unified`. Seine beiden
|
|
Slots teilen sich den einzigen 160.000-Token-KV-Pool. Die `ubatch-size` wurde
|
|
pro Profil auf einen getesteten Wert gesetzt; sie ist **nicht** überall
|
|
identisch.
|
|
|
|
| Profil | Qwen3.8-27B-Variante | Kontext | Slots | Tensor-Split 5080:3060 | Vision-Projektor | MTP Draft | ubatch |
|
|
|---|---|---:|---:|---|---|---:|---:|
|
|
| Fast | IQ4-MIX | 76.800 | 1 | nur 5080 | 3060 | 2 | 64 |
|
|
| Medium | IQ4_XS Pure | 160.000 gemeinsam | 2 | 85:15 | 3060 | 2 | 256 |
|
|
| Large | IQ4_XS Pure | 192.000 | 1 | 86:14 | 3060 | 2 | 256 |
|
|
| Ultra | IQ4_XS Pure | 262.144 | 1 | 80:20 | keiner | 2 | 128 |
|
|
| Uncensored | Abliterated Q4_K_M | 80.000 | 1 | 90:10 | 3060 | 2 | 256 |
|
|
|
|
Tensor-Splits sind Startparameter, keine gemessenen VRAM-Anteile. Der
|
|
Vision-Projektor liegt bei den vier Vision-Profilen auf GPU 1 (3060).
|
|
Der Router bietet die fünf installierten Profile an. Beim abschließenden
|
|
Abgleich am 20. September lief Medium gesund mit MTP2, Microbatch256 und zwei
|
|
Slots. Large ist mit MTP2 neu angelegt und startet beim nächsten Profilwechsel;
|
|
die anderen Profile sind planmäßig gestoppt. Dashboard, Router, Controller,
|
|
Whisper, TTS und Realtime-Voice waren ebenfalls gesund. Der frühere
|
|
Vision-/CLIP-Absturz ist als historischer Befund erhalten, beschreibt aber
|
|
nicht mehr den aktuellen Containerzustand.
|
|
|
|
## Weitere Dienste
|
|
|
|
- Qwen-Image-2.1 INT8 läuft produktiv über gepinntes ComfyUI mit Low-VRAM auf
|
|
der RTX 5080. Der Router verwendet 25 Schritte, Guidance 1 und bis zu vier
|
|
Referenzbilder. Vor jedem Bild startet er automatisch den passenden
|
|
offiziellen Q5-Prompt-Enhancer: PE-T2I für reine Textaufträge oder PE-I2I
|
|
für Referenzbilder. Der Enhancer läuft kurzzeitig auf der RTX 3060, wird vor
|
|
dem Rendern wieder gestoppt und speichert Rohprompt sowie Rewrite im
|
|
Bild-Sidecar. FLUX.2 Klein 9B FP8 bleibt mit seinen Gewichten als
|
|
gestoppter, explizit allowlist-beschränkter Rückfallcontainer erhalten.
|
|
- Qwen3-TTS 1.7B auf 3060 hinter dem TTS-Gateway; kein Piper-Fallback.
|
|
- Whisper.cpp `ggml-small` auf CPU über `/v1/audio/transcriptions`.
|
|
- `mike-ai-embedding` stellt EmbeddingGemma 300M Q8 CPU-only über den privaten
|
|
WireGuard-Endpunkt `http://192.168.1.212:8082/v1/embeddings` bereit. Eine
|
|
Probe mit zwei deutschen Texten lieferte zwei Vektoren mit je 768 Dimensionen.
|
|
Gemessen wurden rund 86 MiB RAM im Leerlauf, rund 1,1 GiB beim vollständigen
|
|
Indexaufbau und 0,044 Sekunden für die abschließende Netzwerkprobe. OpenClaw
|
|
indexierte 107 Dateien mit 1.139 Chunks vollständig; die semantische Suche
|
|
und der 768-dimensionale Vektorindex sind aktiv. Der
|
|
GPU-Versuch war zwar schneller (0,077 Sekunden), ließ im Ultra-Profil aber
|
|
nur 372 MB VRAM auf der RTX 3060 frei und wurde deshalb verworfen.
|
|
- Der gesunde Dienst `mike-ai-realtime-voice` vermittelt OpenClaw Talk über
|
|
WebRTC zwischen Whisper, dem normalen OpenClaw-Agenten und Qwen3-TTS.
|
|
Er braucht keine GPU und keinen Profilwechsel. Das Plugin liegt in
|
|
`integrations/openclaw-athena-talk` und läuft auf Unraid, nicht auf Athena.
|
|
Diktat und hochgeladene M4A-Sprachnachrichten nutzen den separaten
|
|
Transkriptionspfad des Plugins. Plugin 1.3.0 zerlegt längere Browser-Diktate
|
|
während der Aufnahme in überlappende Sechs-Sekunden-Abschnitte und hält so
|
|
den Abschluss innerhalb von OpenClaws festem Fünf-Sekunden-Fenster. OpenClaw
|
|
selbst wurde dafür nicht gepatcht. OpenClaw liefert den fertigen Agententext
|
|
an die Brücke; das Sprechen beginnt daher erst nach Abschluss der
|
|
Agentenantwort. Details und Grenzen stehen in der [Voice-Doku](../services/athena-realtime-voice/README.md).
|
|
- `mike-ai-mikes-applio-ui` läuft gesund und ohne GPU. Die Quelle liegt im
|
|
eigenen Repository [Mikes-Applio-UI](https://git.casaderoll.de/michael/Mikes-applio-ui).
|
|
Der Applio-GPU-Container war beim Abgleich nicht gestartet. Die UI kann
|
|
trotzdem Status, Modelle und vorbereitende Aufgaben anzeigen; eine echte
|
|
Konvertierung verlangt den Applio-Modus.
|
|
|
|
Der vollständige Bestand der **33** angelegten Docker-Container steht im
|
|
[Container-Inventar](CONTAINER_INVENTORY.md). `Created` oder `Exited` bei
|
|
Spezialworkern bedeutet nicht automatisch einen zu entfernenden Testrest.
|
|
|
|
## Git und reproduzierbarer Stand
|
|
|
|
Der laufende Stack liegt unter `/opt/mike-ai/stack`. Beim Router-Audit am
|
|
20. September wurde er auf den veröffentlichten Quellstand synchronisiert.
|
|
Die Funktionsänderungen sind in Commit `6071b1a` enthalten; anschließende
|
|
Dokumentationskorrekturen ändern keine Container. Die früheren Live-Anpassungen
|
|
an Compose, Dashboard und Voice-Bridge wurden bytegenau verglichen und in einem
|
|
lokalen Sicherungscommit erhalten. Controller und Router wurden gezielt ersetzt;
|
|
Zum damaligen Router-Audit behielten Medium und Gateway ihre Startzeiten.
|
|
Die späteren Modelltests und die Medium-Übernahme starteten Medium mehrfach neu;
|
|
der Gateway blieb unverändert. Die späteren Commits sind in der Abschlussübersicht verzeichnet.
|
|
Messwerte, Prüfungen und Rückfallstand stehen im
|
|
[Router-Audit](ROUTER_AUDIT_20260920.md).
|
|
|
|
Ein frischer Clone enthält Quellcode und Compose-Definitionen, aber keine
|
|
lokalen Secrets, Modellgewichte oder persistenten Nutzerdaten. Lokale
|
|
Konfiguration vor jedem Deploy sichern; keinen laufenden Host blind zurücksetzen.
|
|
|
|
Die Applio-UI hat einen eigenen Checkout `/opt/mike-ai/Mikes-Applio-UI`.
|
|
Sein Git-HEAD `3a06139` ist älter als Doggo `eadbc15`. Die laufende
|
|
Anwendungsquelle stimmt bis auf Versionsmetadaten und den später
|
|
korrigierten Dokumentationsstand mit Doggo überein. Siehe
|
|
[Applio-Integrationsdoku](https://git.casaderoll.de/michael/Mikes-applio-ui/src/branch/main/docs/ATHENA-INTEGRATION.md).
|
|
|
|
## Backup und Prüfumfang
|
|
|
|
`mike-ai-backup` lief; der jüngste geprüfte manuelle Archivlauf schloss
|
|
Compose und Voice-Bridge ein. Der Fünf-Stunden-Export-Timer war aktiv, der
|
|
externe Restic-Timer zwar ebenfalls aktiviert, aber ohne seine erforderliche
|
|
`/etc/mike-ai/disaster-backup.env` **nicht** als funktionierende externe
|
|
Sicherung zu werten. Details und Restore-Grenzen: [Backup](RECOVERY.md).
|
|
|
|
Geprüft wurden aktuelle Container- und Quellenstände, Health-Endpunkte sowie
|
|
Text-zu-Bild und Referenzbildbearbeitung mit den beiden Prompt-Enhancern. Keine
|
|
erneuten Langkontext-, Trainings- oder Restore-Tests; ältere Ergebnisse sind im [Update-Audit](UPDATE_AUDIT_20260915.md)
|
|
und [FLUX-Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md) dokumentiert.
|