Make Qwen Image 2.1 the production image worker

This commit is contained in:
Mikei386 committed 2026-09-21 10:41:32 +02:00
1 parent aee31aa045
commit 5de4ac4b25
19 files changed
+531 -346

No files matched your search

+12 -12
View File
@@ -1,6 +1,6 @@
# Athena AI
Stand: **20. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
Stand: **21. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
**llama.cpp 0.4.1** (`b29c606`).
Der [geprüfte Live-Stand](docs/LIVE_STATE.md) beschreibt Profile, GPUs und die
Abweichung zwischen dem bereitgestellten Stack und dem Git-Checkout.
@@ -21,9 +21,8 @@ dokumentieren den ausgerollten Stand, reduzierte Statuslatenzen und Tests.
- genau ein aktives llama.cpp-Profil: Fast, Medium, Large, Ultra oder Uncensored
- Profile Router auf Port 8081
- FLUX.2 Klein 9B FP8 Beta: Transformer/VAE auf RTX 5080, Textencoder auf RTX 3060
- Qwen-Image-2.1 als isolierter, standardmäßig gestoppter Vergleichsworker
([Testablauf](docs/QWEN_IMAGE_21_TEST.md)); nicht produktiv an den Router angebunden
- Qwen-Image-2.1 INT8 als produktiver Bildworker auf der RTX 5080
- FLUX.2 Klein 9B FP8 Beta als gestoppter Rückfallcontainer
- Qwen3-TTS 1.7B auf der RTX 3060 hinter dem TTS-Gateway; kein Piper-Fallback
- Whisper.cpp `small` auf der CPU für lokale deutsche Spracherkennung
- EmbeddingGemma 300M Q8 auf der CPU für OpenClaws hybride Memory-Suche
@@ -44,15 +43,16 @@ dokumentieren den ausgerollten Stand, reduzierte Statuslatenzen und Tests.
Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub
ist nicht mehr Bestandteil der produktiven Architektur.
## Verifizierte Bildauflösung auf dem Live-System
## Produktiver Bildpfad
Der am 12. September geprüfte Live-Worker verwendet **FLUX.2 Klein 9B FP8
Beta**. Die frühere 4B-Angabe war veraltet. Im Auflösungstest
war **1024 × 1024 erfolgreich**, während **1280 × 1280 einen CUDA-OOM** auf
der RTX 5080 auslöste. Höhere Auflösungen sind damit nicht freigegeben;
Zwischenwerte wurden nicht getestet. Die produktive 1024-Begrenzung bleibt
bestehen. Messwerte, Testbedingungen und die Korrektur früherer optimistischer
Schätzungen stehen in [Auflösungstest vom 12. September](docs/FLUX_RESOLUTION_TEST_20260912.md).
Bildanfragen an den Router verwenden seit dem 21. September
**Qwen-Image-2.1 INT8** über gepinntes ComfyUI. Der Worker läuft mit Low-VRAM
auf der RTX 5080, 25 Schritten, CFG 1 und kann bis zu vier Referenzbilder
verarbeiten. Das aktive Textprofil und TTS werden für den Auftrag angehalten
und anschließend wiederhergestellt. Der bisherige FLUX.2-Worker und seine
Gewichte bleiben als gestoppter, explizit allowlist-beschränkter Rückfallpfad
erhalten. Reproduzierbarer Stand und Rückschaltung:
[Qwen-Image-2.1](docs/QWEN_IMAGE_21.md).
## Installation des Repository-Stands