Add dual-GPU FLUX 9B image pipeline

This commit is contained in:
Mikei386
2026-09-07 15:42:45 +02:00
parent 61aa20cb52
commit 1844551534
19 changed files with 945 additions and 51 deletions
+28 -1
View File
@@ -10,7 +10,8 @@ Bild- und Sprachausgabe. **Hermes und die Fach-MCPs laufen auf Unraid.**
- genau ein aktives llama.cpp-Profil: Fast, Medium, Large, Ultra oder Uncensored
- Profile Router auf Port 8081
- FLUX.2-klein-4B für Textbilder und Referenzbild-Bearbeitung auf der RTX 5080
- FLUX.2 Klein 9B FP8 Beta für Textbilder und Referenzbild-Bearbeitung:
Transformer auf RTX 5080, Qwen3-8B-NF4-Textencoder auf RTX 3060
- Qwen3-TTS 1.7B auf der RTX 3060 mit Piper als CPU-Fallback
- Whisper.cpp `large-v3-turbo` auf der CPU für lokale deutsche Spracherkennung
- Live-Dashboard mit 21 Tagen Detailhistorie auf Port 8099
@@ -40,6 +41,11 @@ sudo ./install.sh --config /root/mike-ai-install.env
Das Installationsskript baut llama.cpp und die lokalen Images, lädt die
versionierten Modellartefakte und startet ausschließlich den Athena-Kern.
FLUX.2 Klein 9B ist bei Hugging Face zugriffsbeschränkt. Vor der Installation
müssen die Bedingungen beider BFL-Repositories akzeptiert und ein Token in der
unter `HF_TOKEN_FILE` konfigurierten, nur für root lesbaren Datei abgelegt sein.
Der Token wird ausschließlich als Read-only-Datei in den Download-Container
eingehängt und weder in `stack.env` noch in Git kopiert.
## Betrieb
@@ -95,6 +101,21 @@ Zwei Slots wurden direkt am Router erfolgreich getestet; Hermes verwaltete zwei
gleichzeitig aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der
Standard, bis Hermes' Sitzungsfehler behoben ist.
### Bildgenerierung mit FLUX.2 Klein 9B FP8 Beta
Ein Bildauftrag verwendet beide GPUs exklusiv. Der Profile Controller stoppt
zuerst das aktive llama.cpp-Profil und Qwen3-TTS. Anschließend läuft der
FP8-Transformer auf der RTX 5080 und der in NF4 geladene Qwen3-8B-Textencoder
auf der RTX 3060. Vor dem VAE-Decoding werden Transformer und Textencoder
freigegeben. Nach dem Bildauftrag stoppt der Router den Bild-Worker und stellt
Qwen3-TTS sowie das zuvor aktive Textprofil automatisch wieder her. Piper
bleibt währenddessen als CPU-Fallback verfügbar.
Die Beta ist derzeit bewusst auf `1024x1024`, vier Schritte, Guidance `1.0`,
einen parallelen Auftrag und maximal vier lokale Referenzbilder begrenzt.
Details, Installation, Prüfung und Rollback stehen in
[docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md).
## Endpunkte
- Router: `http://192.168.1.212:8081/v1`
@@ -116,6 +137,11 @@ und bleibt deshalb bei normalen Container-Updates bestehen.
Für Hermes liegt unter `integrations/hermes-qwen3-stream` ein optionales,
persistentes Backend-Plugin. Es nutzt den nativen PCM-Strom und verkürzt den
Beginn der Sprachausgabe, ohne den Modellrouter oder die Textprofile zu ändern.
Bildgenerierung läuft über `/v1/images/generations`; Hermes verwendet dafür den
persistenten Benutzer-Provider `athena-local` mit dem Modellnamen
`FLUX.2-klein-9B-fp8-beta`. Seine versionierte Quelle und Installationshinweise
liegen unter
[`integrations/hermes-athena-image`](integrations/hermes-athena-image).
- Portainer: `https://192.168.1.212:9443`
- Hermes-Dashboard auf Unraid: `http://192.168.1.2:9119`
@@ -150,5 +176,6 @@ Der genaue Sicherungsumfang steht in [docs/RECOVERY.md](docs/RECOVERY.md).
- [docs/STANDARD_PROFILE_MATRIX.md](docs/STANDARD_PROFILE_MATRIX.md) – Profile
- [docs/MCP_SERVERS.md](docs/MCP_SERVERS.md) – produktive Werkzeuge
- [docs/RECOVERY.md](docs/RECOVERY.md) – Backup und Neuaufbau
- [docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md) – 9B-Bildpfad, Test und Rollback
Git enthält keine Secrets, Chatdaten oder Modellgewichte.