Add private Vevo2 voice studio mode
This commit is contained in:
+18
-4
@@ -1,11 +1,13 @@
|
||||
# Athena-Betriebsmodi
|
||||
|
||||
Athena besitzt drei gegenseitig exklusive Betriebsmodi:
|
||||
Athena besitzt vier gegenseitig exklusive Betriebsmodi:
|
||||
|
||||
- `llm`: ein llama.cpp-Profil und Qwen3-TTS laufen; Spezialdienste sind gestoppt.
|
||||
- `music`: ACE-Step 1.5 XL-SFT läuft; alle LLM-, Bild-, TTS- und Separator-Worker sind gestoppt.
|
||||
- `separation`: BS-RoFormer und Demucs trennen Musikspuren; ClearVoice trennt
|
||||
Sprache von Hintergrundgeräuschen. LLM, Bild, TTS und ACE-Step sind gestoppt.
|
||||
- `voice`: Vevo2 überträgt Sprache oder Gesang auf eine gespeicherte
|
||||
Referenzstimme. LLM, Bild, TTS, ACE-Step und Separator sind gestoppt.
|
||||
|
||||
Die Zustandsmaschine lebt im Athena-Router. Das Dashboard und Chat-Clients wie
|
||||
Hermes sind nur Bedienoberflächen derselben API. Der zuletzt aktive LLM-Modus
|
||||
@@ -13,8 +15,8 @@ wird persistent gespeichert und beim Verlassen eines Spezialmodus wieder geladen
|
||||
|
||||
## Bedienung
|
||||
|
||||
Im Athena-Dashboard stehen **LLM-Betrieb**, **Musikstudio** und
|
||||
**Audio trennen** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
|
||||
Im Athena-Dashboard stehen **LLM-Betrieb**, **Musikstudio**, **Audio trennen**
|
||||
und **Voice Studio** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
|
||||
|
||||
- **Original UI · stabil** öffnet die zum laufenden ACE-Step-Image gehörende
|
||||
Gradio-Oberfläche. Sie ist für Cover, Remix und erweiterte Workflows der
|
||||
@@ -48,12 +50,22 @@ nicht eine reine Synthesizer-Spur. Sprache nutzt das 48-kHz-Modell
|
||||
`audio-separator` 0.47.0. Die ältere API-Auswahl kompletter 2-/4-/6-Stem-Sätze
|
||||
bleibt rückwärtskompatibel.
|
||||
|
||||
Das Voice Studio ist ausschließlich über den privaten WireGuard-Pfad unter
|
||||
`http://192.168.1.212:8008` erreichbar. Referenzstimmen werden unter
|
||||
`/data/voice/studio/profiles` gespeichert. Die Oberfläche verlangt vor dem
|
||||
Speichern eine Bestätigung der Nutzungsberechtigung. Vevo2 gibt
|
||||
unkomprimiertes 24-kHz-WAV aus und wandelt sowohl Sprache als auch Gesang;
|
||||
dies ist noch kein Echtzeit-Live-Voice-Changer. Die Gewichte sind
|
||||
CC BY-NC-ND 4.0 lizenziert und werden auf Athena ausschließlich privat und
|
||||
nichtkommerziell eingesetzt.
|
||||
|
||||
Hermes benötigt dafür kein Plugin. Exakt eingegebene Steuerbefehle werden vom
|
||||
Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:
|
||||
|
||||
```text
|
||||
/athena music
|
||||
/athena stems
|
||||
/athena voice
|
||||
/athena llm
|
||||
/athena status
|
||||
```
|
||||
@@ -64,13 +76,15 @@ Die HTTP-Schnittstelle verwendet authentifizierte Requests:
|
||||
GET /mode
|
||||
POST /mode {"mode":"music"}
|
||||
POST /mode {"mode":"separation"}
|
||||
POST /mode {"mode":"voice"}
|
||||
POST /mode {"mode":"llm"}
|
||||
```
|
||||
|
||||
Der Wechsel läuft asynchron. Fortschritt und Fehler stehen unter `mode` in
|
||||
`GET /status`. Der Profile-Controller akzeptiert ausschließlich den mit
|
||||
`com.mike-ai.music-worker=acestep` beziehungsweise
|
||||
`com.mike-ai.stem-separator=bs-roformer` markierten Container; freie
|
||||
`com.mike-ai.stem-separator=bs-roformer` oder
|
||||
`com.mike-ai.voice-worker=vevo2` markierten Container; freie
|
||||
Container- oder Docker-Befehle werden nicht entgegengenommen.
|
||||
|
||||
## Wiederanlauf
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
# Register getesteter Modelle
|
||||
|
||||
Stand: 8. September 2026
|
||||
Stand: 9. September 2026
|
||||
|
||||
Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor
|
||||
jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und
|
||||
@@ -56,6 +56,7 @@ Titelgenerierung und Kontextkompression in Hermes.
|
||||
| 05.09.2026 | Coqui XTTS v2 | deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie | **verworfen und entfernt** |
|
||||
| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** mit Piper-Fallback |
|
||||
| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | **produktiv** |
|
||||
| 09.09.2026 | `RMSnow/Vevo2`, Amphion `26f6883110181f1dbfe95c70a7c7dbaf4de5f42a` | Produktions-HTTP-API mit offizieller 8,6-s-Sprachprobe: Warmstart 12,216 s, Wandlung 2,342 s, Spitzen-VRAM 5.605,6 MiB; gültiges 24-kHz-WAV mit 412.878 Byte; Profilanlage, Download und automatische Job-Bereinigung geprüft | **technischer Ende-zu-Ende-Test bestanden**, privater Voice-Studio-Betatest; Gewichte CC BY-NC-ND 4.0 und daher nicht kommerziell einsetzen |
|
||||
|
||||
## Musikgenerierung
|
||||
|
||||
|
||||
Reference in New Issue
Block a user