Add X-VC voice conversion mode

This commit is contained in:
Mikei386 committed 2026-09-09 16:14:10 +02:00
1 parent 17f1a08d7d
commit 87a2ae5704
15 files changed
+544 -28

No files matched your search

+21 -10
View File
@@ -1,13 +1,16 @@
# Athena-Betriebsmodi
Athena besitzt vier gegenseitig exklusive Betriebsmodi:
Athena besitzt sechs gegenseitig exklusive Betriebsmodi:
- `llm`: ein llama.cpp-Profil und Qwen3-TTS laufen; Spezialdienste sind gestoppt.
- `music`: ACE-Step 1.5 XL-SFT läuft; alle LLM-, Bild-, TTS- und Separator-Worker sind gestoppt.
- `separation`: BS-RoFormer und Demucs trennen Musikspuren; ClearVoice trennt
Sprache von Hintergrundgeräuschen. LLM, Bild, TTS und ACE-Step sind gestoppt.
- `voice`: Vevo2 überträgt Sprache oder Gesang auf eine gespeicherte
- `voice`: OmniVoice erzeugt Sprache aus Text mit einer gewählten
Referenzstimme. LLM, Bild, TTS, ACE-Step und Separator sind gestoppt.
- `voicechange`: X-VC überträgt eine vorhandene Sprachaufnahme auf eine
Referenzstimme und bewahrt dabei Inhalt und Timing. Alle anderen
GPU-Dienste sind gestoppt.
Die Zustandsmaschine lebt im Athena-Router. Das Dashboard und Chat-Clients wie
Hermes sind nur Bedienoberflächen derselben API. Der zuletzt aktive LLM-Modus
@@ -15,8 +18,8 @@ wird persistent gespeichert und beim Verlassen eines Spezialmodus wieder geladen
## Bedienung
Im Athena-Dashboard stehen **LLM-Betrieb**, **Musikstudio**, **Audio trennen**
und **Voice Studio** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
Im Athena-Dashboard stehen **LLM-Betrieb**, **Musikstudio**, **Audio trennen**,
**Voice Studio** und **Voice Changer** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
- **Original UI · stabil** öffnet die zum laufenden ACE-Step-Image gehörende
Gradio-Oberfläche. Sie ist für Cover, Remix und erweiterte Workflows der
@@ -53,11 +56,16 @@ bleibt rückwärtskompatibel.
Das Voice Studio ist ausschließlich über den privaten WireGuard-Pfad unter
`http://192.168.1.212:8008` erreichbar. Referenzstimmen werden unter
`/data/voice/studio/profiles` gespeichert. Die Oberfläche verlangt vor dem
Speichern eine Bestätigung der Nutzungsberechtigung. Vevo2 gibt
unkomprimiertes 24-kHz-WAV aus und wandelt sowohl Sprache als auch Gesang;
dies ist noch kein Echtzeit-Live-Voice-Changer. Die Gewichte sind
CC BY-NC-ND 4.0 lizenziert und werden auf Athena ausschließlich privat und
nichtkommerziell eingesetzt.
Speichern eine Bestätigung der Nutzungsberechtigung. OmniVoice gibt
unkomprimiertes WAV aus und erzeugt Sprache aus Text; es verarbeitet keine
bereits eingesprochene Quellaufnahme.
Der X-VC Voice Changer ist ausschließlich unter
`http://192.168.1.212:8009` erreichbar. Er nimmt eine Quellaufnahme und eine
Referenzstimme an und gibt 16-kHz-PCM-WAV aus. Die dokumentierte Sprachbasis
des verwendeten GLM-4-Voice-Tokenizers ist Chinesisch und Englisch; Deutsch
bleibt deshalb bis zur Hörabnahme ein Qualitätstest und kein zugesagter
Produktionspfad. X-VC läuft ausschließlich auf der RTX 5080.
Hermes benötigt dafür kein Plugin. Exakt eingegebene Steuerbefehle werden vom
Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:
@@ -66,6 +74,7 @@ Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:
/athena music
/athena stems
/athena voice
/athena voicechange
/athena llm
/athena status
```
@@ -77,6 +86,7 @@ GET /mode
POST /mode {"mode":"music"}
POST /mode {"mode":"separation"}
POST /mode {"mode":"voice"}
POST /mode {"mode":"voicechange"}
POST /mode {"mode":"llm"}
```
@@ -84,7 +94,8 @@ Der Wechsel läuft asynchron. Fortschritt und Fehler stehen unter `mode` in
`GET /status`. Der Profile-Controller akzeptiert ausschließlich den mit
`com.mike-ai.music-worker=acestep` beziehungsweise
`com.mike-ai.stem-separator=bs-roformer` oder
`com.mike-ai.voice-worker=vevo2` markierten Container; freie
`com.mike-ai.voice-worker=vevo2` beziehungsweise
`com.mike-ai.voice-change-worker=xvc` markierten Container; freie
Container- oder Docker-Befehle werden nicht entgegengenommen.
## Wiederanlauf