Add dual-GPU FLUX 9B image pipeline
This commit is contained in:
@@ -10,7 +10,8 @@ Bild- und Sprachausgabe. **Hermes und die Fach-MCPs laufen auf Unraid.**
|
||||
|
||||
- genau ein aktives llama.cpp-Profil: Fast, Medium, Large, Ultra oder Uncensored
|
||||
- Profile Router auf Port 8081
|
||||
- FLUX.2-klein-4B für Textbilder und Referenzbild-Bearbeitung auf der RTX 5080
|
||||
- FLUX.2 Klein 9B FP8 Beta für Textbilder und Referenzbild-Bearbeitung:
|
||||
Transformer auf RTX 5080, Qwen3-8B-NF4-Textencoder auf RTX 3060
|
||||
- Qwen3-TTS 1.7B auf der RTX 3060 mit Piper als CPU-Fallback
|
||||
- Whisper.cpp `large-v3-turbo` auf der CPU für lokale deutsche Spracherkennung
|
||||
- Live-Dashboard mit 21 Tagen Detailhistorie auf Port 8099
|
||||
@@ -40,6 +41,11 @@ sudo ./install.sh --config /root/mike-ai-install.env
|
||||
|
||||
Das Installationsskript baut llama.cpp und die lokalen Images, lädt die
|
||||
versionierten Modellartefakte und startet ausschließlich den Athena-Kern.
|
||||
FLUX.2 Klein 9B ist bei Hugging Face zugriffsbeschränkt. Vor der Installation
|
||||
müssen die Bedingungen beider BFL-Repositories akzeptiert und ein Token in der
|
||||
unter `HF_TOKEN_FILE` konfigurierten, nur für root lesbaren Datei abgelegt sein.
|
||||
Der Token wird ausschließlich als Read-only-Datei in den Download-Container
|
||||
eingehängt und weder in `stack.env` noch in Git kopiert.
|
||||
|
||||
## Betrieb
|
||||
|
||||
@@ -95,6 +101,21 @@ Zwei Slots wurden direkt am Router erfolgreich getestet; Hermes verwaltete zwei
|
||||
gleichzeitig aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der
|
||||
Standard, bis Hermes' Sitzungsfehler behoben ist.
|
||||
|
||||
### Bildgenerierung mit FLUX.2 Klein 9B FP8 Beta
|
||||
|
||||
Ein Bildauftrag verwendet beide GPUs exklusiv. Der Profile Controller stoppt
|
||||
zuerst das aktive llama.cpp-Profil und Qwen3-TTS. Anschließend läuft der
|
||||
FP8-Transformer auf der RTX 5080 und der in NF4 geladene Qwen3-8B-Textencoder
|
||||
auf der RTX 3060. Vor dem VAE-Decoding werden Transformer und Textencoder
|
||||
freigegeben. Nach dem Bildauftrag stoppt der Router den Bild-Worker und stellt
|
||||
Qwen3-TTS sowie das zuvor aktive Textprofil automatisch wieder her. Piper
|
||||
bleibt währenddessen als CPU-Fallback verfügbar.
|
||||
|
||||
Die Beta ist derzeit bewusst auf `1024x1024`, vier Schritte, Guidance `1.0`,
|
||||
einen parallelen Auftrag und maximal vier lokale Referenzbilder begrenzt.
|
||||
Details, Installation, Prüfung und Rollback stehen in
|
||||
[docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md).
|
||||
|
||||
## Endpunkte
|
||||
|
||||
- Router: `http://192.168.1.212:8081/v1`
|
||||
@@ -116,6 +137,11 @@ und bleibt deshalb bei normalen Container-Updates bestehen.
|
||||
Für Hermes liegt unter `integrations/hermes-qwen3-stream` ein optionales,
|
||||
persistentes Backend-Plugin. Es nutzt den nativen PCM-Strom und verkürzt den
|
||||
Beginn der Sprachausgabe, ohne den Modellrouter oder die Textprofile zu ändern.
|
||||
Bildgenerierung läuft über `/v1/images/generations`; Hermes verwendet dafür den
|
||||
persistenten Benutzer-Provider `athena-local` mit dem Modellnamen
|
||||
`FLUX.2-klein-9B-fp8-beta`. Seine versionierte Quelle und Installationshinweise
|
||||
liegen unter
|
||||
[`integrations/hermes-athena-image`](integrations/hermes-athena-image).
|
||||
- Portainer: `https://192.168.1.212:9443`
|
||||
- Hermes-Dashboard auf Unraid: `http://192.168.1.2:9119`
|
||||
|
||||
@@ -150,5 +176,6 @@ Der genaue Sicherungsumfang steht in [docs/RECOVERY.md](docs/RECOVERY.md).
|
||||
- [docs/STANDARD_PROFILE_MATRIX.md](docs/STANDARD_PROFILE_MATRIX.md) – Profile
|
||||
- [docs/MCP_SERVERS.md](docs/MCP_SERVERS.md) – produktive Werkzeuge
|
||||
- [docs/RECOVERY.md](docs/RECOVERY.md) – Backup und Neuaufbau
|
||||
- [docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md) – 9B-Bildpfad, Test und Rollback
|
||||
|
||||
Git enthält keine Secrets, Chatdaten oder Modellgewichte.
|
||||
|
||||
Reference in New Issue
Block a user