Add dual-GPU FLUX 9B image pipeline
This commit is contained in:
+25
-4
@@ -6,8 +6,9 @@ flowchart LR
|
||||
H -->|OpenAI API| R[Profile Router<br/>Athena :8081]
|
||||
R --> P[Profile Controller]
|
||||
P --> Q[genau ein llama.cpp-Profil<br/>Qwen Fast / Medium / Large / Ultra / Uncensored]
|
||||
R --> I[FLUX.2-klein-4B<br/>RTX 5080, Text + Editing]
|
||||
R --> T[XTTS RTX 3060<br/>Piper CPU-Fallback]
|
||||
R --> I[FLUX.2 Klein 9B FP8 Beta<br/>RTX 5080 Transformer]
|
||||
I --> E[Qwen3-8B NF4 Textencoder<br/>RTX 3060 während Bildauftrag]
|
||||
R --> T[Qwen3-TTS RTX 3060<br/>Piper CPU-Fallback]
|
||||
R --> STT[Whisper.cpp large-v3-turbo<br/>CPU, lokale Spracherkennung]
|
||||
|
||||
H --> U[MUA / Unraid MCP]
|
||||
@@ -46,9 +47,29 @@ Kontextgröße:
|
||||
| Medium | 160.000 Token |
|
||||
| Large | 192.000 Token |
|
||||
| Ultra | 262.144 Token |
|
||||
| Beta 1 | 192.000 Token |
|
||||
| Uncensored | 80.000 Token |
|
||||
|
||||
## Exklusiver Bildmodus
|
||||
|
||||
Text- und Bildinferenz teilen sich dieselben GPUs und laufen deshalb nicht
|
||||
gleichzeitig. Der Wechsel ist transaktional:
|
||||
|
||||
1. Router merkt sich das aktive Textprofil.
|
||||
2. Profile Controller stoppt alle llama.cpp-Profile und Qwen3-TTS.
|
||||
3. Bild-Worker lädt Qwen3-8B als NF4-Textencoder auf die RTX 3060 und den
|
||||
FLUX.2-Klein-9B-FP8-Transformer auf die RTX 5080.
|
||||
4. Nach dem Prompt-Encoding werden die Embeddings zur RTX 5080 übertragen.
|
||||
5. Vor dem VAE-Decoding werden Textencoder und Transformer freigegeben.
|
||||
6. Der Worker wird gestoppt; anschließend starten Qwen3-TTS und das vorherige
|
||||
Textprofil wieder. Piper bleibt als CPU-Fallback verfügbar.
|
||||
|
||||
Der Bild-Worker ist lazy und besitzt `restart: "no"`; im normalen Textbetrieb
|
||||
belegt er daher keinen VRAM. Container werden über eindeutige Docker-Labels
|
||||
gefunden, nicht über zufällige Container-IDs.
|
||||
|
||||
Die visuelle Fassung liegt als `athena-architecture-map.png` neben dieser Datei.
|
||||
Eine zweite Detailkarte, `athena-gpu-allocation-map.png`, zeigt die
|
||||
profilabhängige Layer-Verteilung auf RTX 5080 und RTX 3060 sowie die festen
|
||||
GPU-Zuordnungen von FLUX.2, Vision-Projektor und XTTS.
|
||||
profilabhängige Layer-Verteilung auf RTX 5080 und RTX 3060. Die PNG-Karten
|
||||
zeigen noch den Stand vor dem 9B-Bildpfad; die aktuelle textuelle Beschreibung
|
||||
in diesem Dokument ist verbindlich.
|
||||
|
||||
Reference in New Issue
Block a user