docs: reconcile Athena overview with verified live deployment
This commit is contained in:
@@ -0,0 +1,68 @@
|
||||
# Geprüfter Live-Stand auf Athena
|
||||
|
||||
Stand: 12. September 2026. Quelle: SSH-Abgleich von Containerbestand,
|
||||
Startkonfiguration und den dokumentierten Laufzeittests auf Athena.
|
||||
|
||||
## Laufzeit und Profile
|
||||
|
||||
Debian 13, RTX 5080 mit 16 GB und RTX 3060 mit 12 GB.
|
||||
Alle fünf Textprofilcontainer verwenden llama.cpp **b10930**, Commit
|
||||
`56381e407c0ccfb3a6f71e668a27a901001d22ce`, Image `mike-ai/llama.cpp:local`
|
||||
beziehungsweise `mike-ai/llama.cpp:b10930`.
|
||||
Image-ID: `sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e`.
|
||||
Die Startoption lautet `--load-mode none`; `--no-mmap` ist entfernt.
|
||||
|
||||
| Profil | Qwen3.8-27B-Variante | Kontext | GPU-Konfiguration 5080:3060 | Vision | MTP Draft |
|
||||
|---|---|---:|---|---|---:|
|
||||
| Fast | IQ4-MIX | 76.800 | Textmodell nur 5080 | ja | 2 |
|
||||
| Medium | IQ4_XS Pure | 160.000 | 85:15 | ja | 3 |
|
||||
| Large | IQ4_XS Pure | 192.000 | 86:14 | ja | 3 |
|
||||
| Ultra | IQ4_XS Pure | 262.144 | 80:20 | nein | 2 |
|
||||
| Uncensored | Abliterated Q4_K_M | 80.000 | 90:10 | ja | 2 |
|
||||
|
||||
Alle Profile nutzen einen Slot. Die GPU-Verhältnisse sind konfigurierte
|
||||
Tensor-Splits, keine gemessenen VRAM-Prozentsätze; KV-Cache, Projektor und
|
||||
weitere Dienste benötigen zusätzlich Speicher. Uncensored nutzt beide Karten,
|
||||
der Vision-Projektor liegt auf der 3060.
|
||||
|
||||
Im LLM-Modus läuft genau ein Textprofil. Zum Abschluss des Buildtests war
|
||||
Uncensored aktiv; beim späteren Dokumentationsabgleich war Medium aktiv.
|
||||
Das aktive Profil ist ein veränderlicher Betriebszustand.
|
||||
`beta1` steht zusätzlich in der Repository-Matrix, ist auf Athena aber nicht
|
||||
installiert und wurde beim Update nicht getestet.
|
||||
|
||||
## Bild und Sprache
|
||||
|
||||
- FLUX.2 Klein **9B FP8 Beta**, Transformer und VAE auf 5080,
|
||||
Qwen3-8B-Textencoder in NF4 auf 3060.
|
||||
- Bildaufträge pausieren LLM und Qwen3-TTS und stellen sie danach wieder her.
|
||||
Produktiv maximal 1024 × 1024, vier Schritte, Guidance 1,
|
||||
höchstens vier Referenzbilder und 128 Textencoder-Tokens.
|
||||
- 1024 × 1024 erfolgreich; 1280 × 1280 CUDA-OOM. Zwischenwerte und höhere
|
||||
Größen nicht geprüft. Keine Freigabe oberhalb 1024.
|
||||
- Qwen3-TTS 1.7B auf 3060 hinter TTS-Gateway. Kein Piper-Container/Fallback.
|
||||
- Whisper.cpp small (`/models/ggml-small.bin`) auf CPU, persistentes Whisper-Volume.
|
||||
|
||||
## Git und bereitgestellte Dateien
|
||||
|
||||
Der Live-Checkout `/opt/mike-ai/stack` zeigt beim Abgleich Git-HEAD `5d8abd4`.
|
||||
Seine Arbeitsdateien enthalten jedoch neuere Änderungen und zusätzliche
|
||||
Spezialdienste. Der HEAD ist daher **kein Nachweis der laufenden Buildversion**.
|
||||
Das b10930-Update wurde in Gitea mit Commit `2415b27` dokumentiert und gepinnt.
|
||||
Dieses Dokumentationsupdate gleicht die zentralen Markdown-Dateien zwischen
|
||||
Git und Athena ab; es setzt den Live-Checkout nicht zurück und übernimmt
|
||||
nicht pauschal seine übrigen uncommitteten Änderungen.
|
||||
Ein frischer Clone ist deshalb noch kein vollständiges Abbild aller Live-Dienste.
|
||||
|
||||
## Prüfumfang und Belege
|
||||
|
||||
Alle fünf Textprofile bestanden kurze Textproben. Für Uncensored und Medium
|
||||
wurden zusätzlich Tools und Vision geprüft; Uncensored bestand einen
|
||||
72.802-Token-Kontexttest. Kein Vollkontext- oder Langzeittest aller Profile.
|
||||
Die übrigen Spezialcontainer wurden bei diesem Abgleich nur inventarisiert.
|
||||
|
||||
- [Build, Tests und Rückfall](LLAMA_B10930_UPDATE_20260912.md)
|
||||
- [FLUX-Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md)
|
||||
- [Container-Inventar](CONTAINER_INVENTORY.md)
|
||||
- [Backup-Stand](RECOVERY.md)
|
||||
- [Verbindliche Host-Regeln](REMOTE_HOST_RULES.md)
|
||||
Reference in New Issue
Block a user