Remove Beta 1 and Piper fallback

This commit is contained in:
Mikei386
2026-09-10 13:17:57 +02:00
parent 52482627be
commit 08ff3d7c4e
38 changed files with 94 additions and 484 deletions
+2 -3
View File
@@ -8,7 +8,7 @@ flowchart LR
P --> Q[genau ein llama.cpp-Profil<br/>Qwen Fast / Medium / Large / Ultra / Uncensored]
R --> I[FLUX.2 Klein 9B FP8 Beta<br/>RTX 5080 Transformer]
I --> E[Qwen3-8B NF4 Textencoder<br/>RTX 3060 während Bildauftrag]
R --> T[Qwen3-TTS RTX 3060<br/>Piper CPU-Fallback]
R --> T[Qwen3-TTS RTX 3060<br/>Normalisierungs- und Streaming-Gateway]
R --> STT[Whisper.cpp ggml-small<br/>CPU, lokale Spracherkennung]
H --> U[MUA / Unraid MCP]
@@ -50,7 +50,6 @@ Kontextgröße:
| Medium | 160.000 Token |
| Large | 192.000 Token |
| Ultra | 262.144 Token |
| Beta 1 | 112.000 Token |
| Uncensored | 80.000 Token |
## Exklusiver Bildmodus
@@ -65,7 +64,7 @@ gleichzeitig. Der Wechsel ist transaktional:
4. Nach dem Prompt-Encoding werden die Embeddings zur RTX 5080 übertragen.
5. Vor dem VAE-Decoding werden Textencoder und Transformer freigegeben.
6. Der Worker wird gestoppt; anschließend starten Qwen3-TTS und das vorherige
Textprofil wieder. Piper bleibt als CPU-Fallback verfügbar.
Textprofil wieder. Während der exklusiven Bildphase steht kein TTS bereit.
Der Bild-Worker ist lazy und besitzt `restart: "no"`; im normalen Textbetrieb
belegt er daher keinen VRAM. Container werden über eindeutige Docker-Labels