69 lines
3.4 KiB
Markdown
69 lines
3.4 KiB
Markdown
# Geprüfter Live-Stand auf Athena
|
||
|
||
Stand: 12. September 2026. Quelle: SSH-Abgleich von Containerbestand,
|
||
Startkonfiguration und den dokumentierten Laufzeittests auf Athena.
|
||
|
||
## Laufzeit und Profile
|
||
|
||
Debian 13, RTX 5080 mit 16 GB und RTX 3060 mit 12 GB.
|
||
Alle fünf Textprofilcontainer verwenden llama.cpp **b10930**, Commit
|
||
`56381e407c0ccfb3a6f71e668a27a901001d22ce`, Image `mike-ai/llama.cpp:local`
|
||
beziehungsweise `mike-ai/llama.cpp:b10930`.
|
||
Image-ID: `sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e`.
|
||
Die Startoption lautet `--load-mode none`; `--no-mmap` ist entfernt.
|
||
|
||
| Profil | Qwen3.8-27B-Variante | Kontext | GPU-Konfiguration 5080:3060 | Vision | MTP Draft |
|
||
|---|---|---:|---|---|---:|
|
||
| Fast | IQ4-MIX | 76.800 | Textmodell nur 5080 | ja | 2 |
|
||
| Medium | IQ4_XS Pure | 160.000 | 85:15 | ja | 3 |
|
||
| Large | IQ4_XS Pure | 192.000 | 86:14 | ja | 3 |
|
||
| Ultra | IQ4_XS Pure | 262.144 | 80:20 | nein | 2 |
|
||
| Uncensored | Abliterated Q4_K_M | 80.000 | 90:10 | ja | 2 |
|
||
|
||
Alle Profile nutzen einen Slot. Die GPU-Verhältnisse sind konfigurierte
|
||
Tensor-Splits, keine gemessenen VRAM-Prozentsätze; KV-Cache, Projektor und
|
||
weitere Dienste benötigen zusätzlich Speicher. Uncensored nutzt beide Karten,
|
||
der Vision-Projektor liegt auf der 3060.
|
||
|
||
Im LLM-Modus läuft genau ein Textprofil. Zum Abschluss des Buildtests war
|
||
Uncensored aktiv; beim späteren Dokumentationsabgleich war Medium aktiv.
|
||
Das aktive Profil ist ein veränderlicher Betriebszustand.
|
||
`beta1` steht zusätzlich in der Repository-Matrix, ist auf Athena aber nicht
|
||
installiert und wurde beim Update nicht getestet.
|
||
|
||
## Bild und Sprache
|
||
|
||
- FLUX.2 Klein **9B FP8 Beta**, Transformer und VAE auf 5080,
|
||
Qwen3-8B-Textencoder in NF4 auf 3060.
|
||
- Bildaufträge pausieren LLM und Qwen3-TTS und stellen sie danach wieder her.
|
||
Produktiv maximal 1024 × 1024, vier Schritte, Guidance 1,
|
||
höchstens vier Referenzbilder und 128 Textencoder-Tokens.
|
||
- 1024 × 1024 erfolgreich; 1280 × 1280 CUDA-OOM. Zwischenwerte und höhere
|
||
Größen nicht geprüft. Keine Freigabe oberhalb 1024.
|
||
- Qwen3-TTS 1.7B auf 3060 hinter TTS-Gateway. Kein Piper-Container/Fallback.
|
||
- Whisper.cpp small (`/models/ggml-small.bin`) auf CPU, persistentes Whisper-Volume.
|
||
|
||
## Git und bereitgestellte Dateien
|
||
|
||
Der Live-Checkout `/opt/mike-ai/stack` zeigt beim Abgleich Git-HEAD `5d8abd4`.
|
||
Seine Arbeitsdateien enthalten jedoch neuere Änderungen und zusätzliche
|
||
Spezialdienste. Der HEAD ist daher **kein Nachweis der laufenden Buildversion**.
|
||
Das b10930-Update wurde in Gitea mit Commit `2415b27` dokumentiert und gepinnt.
|
||
Dieses Dokumentationsupdate gleicht die zentralen Markdown-Dateien zwischen
|
||
Git und Athena ab; es setzt den Live-Checkout nicht zurück und übernimmt
|
||
nicht pauschal seine übrigen uncommitteten Änderungen.
|
||
Ein frischer Clone ist deshalb noch kein vollständiges Abbild aller Live-Dienste.
|
||
|
||
## Prüfumfang und Belege
|
||
|
||
Alle fünf Textprofile bestanden kurze Textproben. Für Uncensored und Medium
|
||
wurden zusätzlich Tools und Vision geprüft; Uncensored bestand einen
|
||
72.802-Token-Kontexttest. Kein Vollkontext- oder Langzeittest aller Profile.
|
||
Die übrigen Spezialcontainer wurden bei diesem Abgleich nur inventarisiert.
|
||
|
||
- [Build, Tests und Rückfall](LLAMA_B10930_UPDATE_20260912.md)
|
||
- [FLUX-Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md)
|
||
- [Container-Inventar](CONTAINER_INVENTORY.md)
|
||
- [Backup-Stand](RECOVERY.md)
|
||
- [Verbindliche Host-Regeln](REMOTE_HOST_RULES.md)
|