Files
AI-Profile-Router/docs/LIVE_STATE.md
T

69 lines
3.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Geprüfter Live-Stand auf Athena
Stand: 12. September 2026. Quelle: SSH-Abgleich von Containerbestand,
Startkonfiguration und den dokumentierten Laufzeittests auf Athena.
## Laufzeit und Profile
Debian 13, RTX 5080 mit 16 GB und RTX 3060 mit 12 GB.
Alle fünf Textprofilcontainer verwenden llama.cpp **b10930**, Commit
`56381e407c0ccfb3a6f71e668a27a901001d22ce`, Image `mike-ai/llama.cpp:local`
beziehungsweise `mike-ai/llama.cpp:b10930`.
Image-ID: `sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e`.
Die Startoption lautet `--load-mode none`; `--no-mmap` ist entfernt.
| Profil | Qwen3.8-27B-Variante | Kontext | GPU-Konfiguration 5080:3060 | Vision | MTP Draft |
|---|---|---:|---|---|---:|
| Fast | IQ4-MIX | 76.800 | Textmodell nur 5080 | ja | 2 |
| Medium | IQ4_XS Pure | 160.000 | 85:15 | ja | 3 |
| Large | IQ4_XS Pure | 192.000 | 86:14 | ja | 3 |
| Ultra | IQ4_XS Pure | 262.144 | 80:20 | nein | 2 |
| Uncensored | Abliterated Q4_K_M | 80.000 | 90:10 | ja | 2 |
Alle Profile nutzen einen Slot. Die GPU-Verhältnisse sind konfigurierte
Tensor-Splits, keine gemessenen VRAM-Prozentsätze; KV-Cache, Projektor und
weitere Dienste benötigen zusätzlich Speicher. Uncensored nutzt beide Karten,
der Vision-Projektor liegt auf der 3060.
Im LLM-Modus läuft genau ein Textprofil. Zum Abschluss des Buildtests war
Uncensored aktiv; beim späteren Dokumentationsabgleich war Medium aktiv.
Das aktive Profil ist ein veränderlicher Betriebszustand.
`beta1` steht zusätzlich in der Repository-Matrix, ist auf Athena aber nicht
installiert und wurde beim Update nicht getestet.
## Bild und Sprache
- FLUX.2 Klein **9B FP8 Beta**, Transformer und VAE auf 5080,
Qwen3-8B-Textencoder in NF4 auf 3060.
- Bildaufträge pausieren LLM und Qwen3-TTS und stellen sie danach wieder her.
Produktiv maximal 1024 × 1024, vier Schritte, Guidance 1,
höchstens vier Referenzbilder und 128 Textencoder-Tokens.
- 1024 × 1024 erfolgreich; 1280 × 1280 CUDA-OOM. Zwischenwerte und höhere
Größen nicht geprüft. Keine Freigabe oberhalb 1024.
- Qwen3-TTS 1.7B auf 3060 hinter TTS-Gateway. Kein Piper-Container/Fallback.
- Whisper.cpp small (`/models/ggml-small.bin`) auf CPU, persistentes Whisper-Volume.
## Git und bereitgestellte Dateien
Der Live-Checkout `/opt/mike-ai/stack` zeigt beim Abgleich Git-HEAD `5d8abd4`.
Seine Arbeitsdateien enthalten jedoch neuere Änderungen und zusätzliche
Spezialdienste. Der HEAD ist daher **kein Nachweis der laufenden Buildversion**.
Das b10930-Update wurde in Gitea mit Commit `2415b27` dokumentiert und gepinnt.
Dieses Dokumentationsupdate gleicht die zentralen Markdown-Dateien zwischen
Git und Athena ab; es setzt den Live-Checkout nicht zurück und übernimmt
nicht pauschal seine übrigen uncommitteten Änderungen.
Ein frischer Clone ist deshalb noch kein vollständiges Abbild aller Live-Dienste.
## Prüfumfang und Belege
Alle fünf Textprofile bestanden kurze Textproben. Für Uncensored und Medium
wurden zusätzlich Tools und Vision geprüft; Uncensored bestand einen
72.802-Token-Kontexttest. Kein Vollkontext- oder Langzeittest aller Profile.
Die übrigen Spezialcontainer wurden bei diesem Abgleich nur inventarisiert.
- [Build, Tests und Rückfall](LLAMA_B10930_UPDATE_20260912.md)
- [FLUX-Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md)
- [Container-Inventar](CONTAINER_INVENTORY.md)
- [Backup-Stand](RECOVERY.md)
- [Verbindliche Host-Regeln](REMOTE_HOST_RULES.md)