Make Qwen Image 2.1 the production image worker
This commit is contained in:
1 parent
aee31aa045
commit
5de4ac4b25
19 files changed
+531
-346
No files matched your search
@@ -1,6 +1,6 @@
|
||||
# Athena AI
|
||||
|
||||
Stand: **20. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
|
||||
Stand: **21. September 2026**, auf Athena geprüft. Die Textprofil-Images verwenden
|
||||
**llama.cpp 0.4.1** (`b29c606`).
|
||||
Der [geprüfte Live-Stand](docs/LIVE_STATE.md) beschreibt Profile, GPUs und die
|
||||
Abweichung zwischen dem bereitgestellten Stack und dem Git-Checkout.
|
||||
@@ -21,9 +21,8 @@ dokumentieren den ausgerollten Stand, reduzierte Statuslatenzen und Tests.
|
||||
|
||||
- genau ein aktives llama.cpp-Profil: Fast, Medium, Large, Ultra oder Uncensored
|
||||
- Profile Router auf Port 8081
|
||||
- FLUX.2 Klein 9B FP8 Beta: Transformer/VAE auf RTX 5080, Textencoder auf RTX 3060
|
||||
- Qwen-Image-2.1 als isolierter, standardmäßig gestoppter Vergleichsworker
|
||||
([Testablauf](docs/QWEN_IMAGE_21_TEST.md)); nicht produktiv an den Router angebunden
|
||||
- Qwen-Image-2.1 INT8 als produktiver Bildworker auf der RTX 5080
|
||||
- FLUX.2 Klein 9B FP8 Beta als gestoppter Rückfallcontainer
|
||||
- Qwen3-TTS 1.7B auf der RTX 3060 hinter dem TTS-Gateway; kein Piper-Fallback
|
||||
- Whisper.cpp `small` auf der CPU für lokale deutsche Spracherkennung
|
||||
- EmbeddingGemma 300M Q8 auf der CPU für OpenClaws hybride Memory-Suche
|
||||
@@ -44,15 +43,16 @@ dokumentieren den ausgerollten Stand, reduzierte Statuslatenzen und Tests.
|
||||
Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub
|
||||
ist nicht mehr Bestandteil der produktiven Architektur.
|
||||
|
||||
## Verifizierte Bildauflösung auf dem Live-System
|
||||
## Produktiver Bildpfad
|
||||
|
||||
Der am 12. September geprüfte Live-Worker verwendet **FLUX.2 Klein 9B FP8
|
||||
Beta**. Die frühere 4B-Angabe war veraltet. Im Auflösungstest
|
||||
war **1024 × 1024 erfolgreich**, während **1280 × 1280 einen CUDA-OOM** auf
|
||||
der RTX 5080 auslöste. Höhere Auflösungen sind damit nicht freigegeben;
|
||||
Zwischenwerte wurden nicht getestet. Die produktive 1024-Begrenzung bleibt
|
||||
bestehen. Messwerte, Testbedingungen und die Korrektur früherer optimistischer
|
||||
Schätzungen stehen in [Auflösungstest vom 12. September](docs/FLUX_RESOLUTION_TEST_20260912.md).
|
||||
Bildanfragen an den Router verwenden seit dem 21. September
|
||||
**Qwen-Image-2.1 INT8** über gepinntes ComfyUI. Der Worker läuft mit Low-VRAM
|
||||
auf der RTX 5080, 25 Schritten, CFG 1 und kann bis zu vier Referenzbilder
|
||||
verarbeiten. Das aktive Textprofil und TTS werden für den Auftrag angehalten
|
||||
und anschließend wiederhergestellt. Der bisherige FLUX.2-Worker und seine
|
||||
Gewichte bleiben als gestoppter, explizit allowlist-beschränkter Rückfallpfad
|
||||
erhalten. Reproduzierbarer Stand und Rückschaltung:
|
||||
[Qwen-Image-2.1](docs/QWEN_IMAGE_21.md).
|
||||
|
||||
## Installation des Repository-Stands
|
||||
|
||||
|
||||
Reference in new issue
Block a user