docs: reconcile Athena overview with verified live deployment

This commit is contained in:
Mikei386
2026-09-12 20:47:28 +02:00
parent 2415b27160
commit 9fe51390f6
8 changed files with 223 additions and 134 deletions
+68
View File
@@ -0,0 +1,68 @@
# Geprüfter Live-Stand auf Athena
Stand: 12. September 2026. Quelle: SSH-Abgleich von Containerbestand,
Startkonfiguration und den dokumentierten Laufzeittests auf Athena.
## Laufzeit und Profile
Debian 13, RTX 5080 mit 16 GB und RTX 3060 mit 12 GB.
Alle fünf Textprofilcontainer verwenden llama.cpp **b10930**, Commit
`56381e407c0ccfb3a6f71e668a27a901001d22ce`, Image `mike-ai/llama.cpp:local`
beziehungsweise `mike-ai/llama.cpp:b10930`.
Image-ID: `sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e`.
Die Startoption lautet `--load-mode none`; `--no-mmap` ist entfernt.
| Profil | Qwen3.8-27B-Variante | Kontext | GPU-Konfiguration 5080:3060 | Vision | MTP Draft |
|---|---|---:|---|---|---:|
| Fast | IQ4-MIX | 76.800 | Textmodell nur 5080 | ja | 2 |
| Medium | IQ4_XS Pure | 160.000 | 85:15 | ja | 3 |
| Large | IQ4_XS Pure | 192.000 | 86:14 | ja | 3 |
| Ultra | IQ4_XS Pure | 262.144 | 80:20 | nein | 2 |
| Uncensored | Abliterated Q4_K_M | 80.000 | 90:10 | ja | 2 |
Alle Profile nutzen einen Slot. Die GPU-Verhältnisse sind konfigurierte
Tensor-Splits, keine gemessenen VRAM-Prozentsätze; KV-Cache, Projektor und
weitere Dienste benötigen zusätzlich Speicher. Uncensored nutzt beide Karten,
der Vision-Projektor liegt auf der 3060.
Im LLM-Modus läuft genau ein Textprofil. Zum Abschluss des Buildtests war
Uncensored aktiv; beim späteren Dokumentationsabgleich war Medium aktiv.
Das aktive Profil ist ein veränderlicher Betriebszustand.
`beta1` steht zusätzlich in der Repository-Matrix, ist auf Athena aber nicht
installiert und wurde beim Update nicht getestet.
## Bild und Sprache
- FLUX.2 Klein **9B FP8 Beta**, Transformer und VAE auf 5080,
Qwen3-8B-Textencoder in NF4 auf 3060.
- Bildaufträge pausieren LLM und Qwen3-TTS und stellen sie danach wieder her.
Produktiv maximal 1024 × 1024, vier Schritte, Guidance 1,
höchstens vier Referenzbilder und 128 Textencoder-Tokens.
- 1024 × 1024 erfolgreich; 1280 × 1280 CUDA-OOM. Zwischenwerte und höhere
Größen nicht geprüft. Keine Freigabe oberhalb 1024.
- Qwen3-TTS 1.7B auf 3060 hinter TTS-Gateway. Kein Piper-Container/Fallback.
- Whisper.cpp small (`/models/ggml-small.bin`) auf CPU, persistentes Whisper-Volume.
## Git und bereitgestellte Dateien
Der Live-Checkout `/opt/mike-ai/stack` zeigt beim Abgleich Git-HEAD `5d8abd4`.
Seine Arbeitsdateien enthalten jedoch neuere Änderungen und zusätzliche
Spezialdienste. Der HEAD ist daher **kein Nachweis der laufenden Buildversion**.
Das b10930-Update wurde in Gitea mit Commit `2415b27` dokumentiert und gepinnt.
Dieses Dokumentationsupdate gleicht die zentralen Markdown-Dateien zwischen
Git und Athena ab; es setzt den Live-Checkout nicht zurück und übernimmt
nicht pauschal seine übrigen uncommitteten Änderungen.
Ein frischer Clone ist deshalb noch kein vollständiges Abbild aller Live-Dienste.
## Prüfumfang und Belege
Alle fünf Textprofile bestanden kurze Textproben. Für Uncensored und Medium
wurden zusätzlich Tools und Vision geprüft; Uncensored bestand einen
72.802-Token-Kontexttest. Kein Vollkontext- oder Langzeittest aller Profile.
Die übrigen Spezialcontainer wurden bei diesem Abgleich nur inventarisiert.
- [Build, Tests und Rückfall](LLAMA_B10930_UPDATE_20260912.md)
- [FLUX-Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md)
- [Container-Inventar](CONTAINER_INVENTORY.md)
- [Backup-Stand](RECOVERY.md)
- [Verbindliche Host-Regeln](REMOTE_HOST_RULES.md)