Stabilize German XTTS speech output
This commit is contained in:
@@ -105,9 +105,12 @@ Ultra bleibt für maximalen Kontext bewusst text-only.
|
||||
|
||||
Open WebUI spricht ausschließlich den Router an. Dieser reicht TTS intern an
|
||||
das TTS-Gateway weiter. Das Gateway nutzt primär XTTS-v2 mit der Stimme
|
||||
`Annmarie Nele` auf der RTX 3060. Deutsche Texte werden an bekannten
|
||||
englischen IT-Begriffen segmentiert; reine englische Texte laufen vollständig
|
||||
mit `language=en`. Da der offizielle XTTS-Streamingserver nur einen Auftrag
|
||||
`Annmarie Nele` auf der RTX 3060. Gemischte deutsch-englische Antworten laufen
|
||||
bewusst als vollständige deutsche Satzblöcke: Das vermeidet die langen Pausen,
|
||||
Tonhöhensprünge und unverständlichen Übergänge, die beim Zusammensetzen vieler
|
||||
kurzer Sprachsegmente entstanden. Vollständig englische Texte werden weiterhin
|
||||
automatisch mit `language=en` gesprochen. Da der offizielle
|
||||
XTTS-Streamingserver nur einen Auftrag
|
||||
gleichzeitig unterstützt, serialisiert das Gateway die Aufträge. Bei Fehler,
|
||||
Timeout oder belegter Queue übernimmt automatisch Piper auf der CPU. Kein
|
||||
TTS-Port wird veröffentlicht. Der äußere Kompatibilitätsname bleibt bewusst
|
||||
|
||||
+1
-1
@@ -13,7 +13,7 @@
|
||||
| Unraid-MCP | lokales `runraid`-Binary | eigener optionaler Container | optional |
|
||||
| Whisper | ggml-org/whisper.cpp | Service im Router-Deploy | optional |
|
||||
| XTTS-v2 | Coqui, offizielles CUDA-12.1-Image per Digest | RTX-3060-Container, Stimme `Annmarie Nele`, CPML | Kern |
|
||||
| TTS-Gateway | `platform/docker/tts-gateway/` | interne Queue, Deutsch/Englisch-Segmentierung und Piper-Fallback | Kern |
|
||||
| TTS-Gateway | `platform/docker/tts-gateway/` | interne Queue, stabile deutsche Satzblöcke, automatische Erkennung rein englischer Texte und Piper-Fallback | Kern |
|
||||
| Piper TTS | Open Home Foundation, `piper-tts` 1.6.0 | interner CPU-Fallback, Stimme `de_DE-thorsten-high` | Kern |
|
||||
| FLUX.2 klein | Black Forest Labs | Worker und Modellmanifest | optional |
|
||||
| LLama-GUI | separates Upstream-Projekt | nur Betriebsrolle dokumentiert | optional |
|
||||
|
||||
@@ -88,8 +88,12 @@ intern an das TTS-Gateway weiter. Primär spricht XTTS-v2 mit `Annmarie Nele`
|
||||
auf der RTX 3060; bei Fehlern oder Queue-Timeout übernimmt Piper auf der CPU.
|
||||
Der Port 8085 wird nicht am Host veröffentlicht. Ein
|
||||
Restore setzt zusätzlich die vier persistenten Audiofelder gezielt neu, damit
|
||||
alte Werte wie `tts-1` oder `coral` die Compose-Vorgaben nicht überstimmen. Ein
|
||||
Ende-zu-Ende-Test ohne Ausgabe des API-Schlüssels:
|
||||
alte Werte wie `tts-1` oder `coral` die Compose-Vorgaben nicht überstimmen.
|
||||
`TTS_CODE_SWITCH_ENABLED=false` hält gemischte Antworten als zusammenhängende
|
||||
deutsche Satzblöcke. Einzelne englische Fachbegriffe werden damit zwar deutsch
|
||||
ausgesprochen, die Ausgabe bleibt jedoch flüssig und verständlich. Reine
|
||||
englische Texte erkennt das Gateway weiterhin automatisch. Ein Ende-zu-Ende-Test
|
||||
ohne Ausgabe des API-Schlüssels:
|
||||
|
||||
```bash
|
||||
set -a; source /etc/mike-ai/stack.env; set +a
|
||||
|
||||
Reference in New Issue
Block a user