Add Seed-VC and Applio studio modes
This commit is contained in:
1 parent
51ed201f6c
commit
13a6714b2b
16 files changed
+410
-33
No files matched your search
@@ -2,7 +2,7 @@
|
||||
|
||||
Stand: 9. September 2026
|
||||
|
||||
Athena besteht derzeit aus 23 Docker-Containern. Nicht jeder Container enthält
|
||||
Athena besteht derzeit aus 25 Docker-Containern. Nicht jeder Container enthält
|
||||
ein KI-Modell: Router, Oberflächen, Netzwerk, Steuerung und Sicherung sind
|
||||
gewöhnliche Dienste. Die rechenintensiven GPU-Worker werden absichtlich nur bei
|
||||
Bedarf gestartet. Ein Container im Zustand `Created` oder `Exited (0)` ist daher
|
||||
@@ -11,6 +11,7 @@ nicht automatisch ein ungenutzter Rest.
|
||||
| Container | Modell oder wesentliche Komponente | Aufgabe |
|
||||
|---|---|---|
|
||||
| `mike-ai-backup` | kein Modell; Offen Docker Volume Backup | Sichert `/data`, `/etc/mike-ai`, den Stack und die persistenten Docker-Volumes im Fünf-Stunden-Takt. |
|
||||
| `mike-ai-applio-studio` | Applio/RVC; Stimmenmodelle werden nutzerseitig ergänzt | Vollständige RVC-Oberfläche für Inferenz, Modellverwaltung und Training auf der RTX 5080. |
|
||||
| `mike-ai-image-worker` | FLUX.2 Klein 9B FP8, Qwen3-8B NF4 Textencoder und VAE | Erzeugt und bearbeitet Bilder transaktional; nutzt während eines Auftrags RTX 5080 und RTX 3060. |
|
||||
| `mike-ai-llama-beta1` | Qwen3.8-27B GSQ-RCO `IQ3_S-MTP`, Qwen-MMProj BF16 | Experimentelles Beta-Profil mit 112.000 Token Kontext; wird nur auf Anforderung geladen. |
|
||||
| `mike-ai-llama-dashboard` | kein Modell | Zeigt Telemetrie, Profile, GPU-Nutzung und Betriebsarten an und bietet die Modusumschaltung. |
|
||||
@@ -27,6 +28,7 @@ nicht automatisch ein ungenutzter Rest.
|
||||
| `mike-ai-profile-controller` | kein Modell | Startet und stoppt ausschließlich freigegebene Modellprofile und Spezialworker in einer sicheren Reihenfolge. |
|
||||
| `mike-ai-qwen3-tts` | `Qwen/Qwen3-TTS-12Hz-1.7B-Base`, Stimme Serena | Hochwertige deutsche Sprachausgabe auf der RTX 3060 im LLM-Betrieb. |
|
||||
| `mike-ai-router` | kein eigenes Modell | Einzige OpenAI-kompatible Modelladresse; koordiniert Profile, Bildaufträge, Sprache und Betriebsarten. |
|
||||
| `mike-ai-seed-vc-studio` | Seed-VC V1; Gewichte werden beim ersten Auftrag geladen | Zero-Shot-Sprach- und Gesangswandlung anhand einer Referenzaufnahme auf der RTX 5080. |
|
||||
| `mike-ai-stem-separator` | BS-RoFormer Viperx 1297, `htdemucs_ft`, `htdemucs_6s`, `MossFormer2_SE_48K` | Trennt Gesang, Instrumente oder Sprache/Hintergrundgeräusche im exklusiven Separationsmodus. |
|
||||
| `mike-ai-tts-gateway` | kein eigenes Modell | Normalisiert Text, leitet TTS an Qwen3-TTS weiter und fällt bei Bedarf auf Piper zurück. |
|
||||
| `mike-ai-voice-studio` | `k2-fsa/OmniVoice` 0.2.1 mit Whisper-ASR | Erzeugt Text-to-Speech mit einer Referenzstimme; kein Audio-to-Audio-Voice-Changer. |
|
||||
|
||||
+23
-3
@@ -1,6 +1,6 @@
|
||||
# Athena-Betriebsmodi
|
||||
|
||||
Athena besitzt fünf gegenseitig exklusive Betriebsmodi:
|
||||
Athena besitzt sieben gegenseitig exklusive Betriebsmodi:
|
||||
|
||||
- `llm`: ein llama.cpp-Profil und Qwen3-TTS laufen; Spezialdienste sind gestoppt.
|
||||
- `music`: ACE-Step 1.5 XL-SFT läuft; alle LLM-, Bild-, TTS- und Separator-Worker sind gestoppt.
|
||||
@@ -11,6 +11,10 @@ Athena besitzt fünf gegenseitig exklusive Betriebsmodi:
|
||||
- `voicechange`: X-VC überträgt eine vorhandene Sprachaufnahme auf eine
|
||||
Referenzstimme und bewahrt dabei Inhalt und Timing. Alle anderen
|
||||
GPU-Dienste sind gestoppt.
|
||||
- `seedvc`: Seed-VC V1 wandelt Sprache oder Gesang ohne Training anhand einer
|
||||
Referenzaufnahme um. Alle anderen GPU-Dienste sind gestoppt.
|
||||
- `applio`: Applio stellt RVC-Inferenz, Modellverwaltung und Training bereit.
|
||||
Alle anderen GPU-Dienste sind gestoppt.
|
||||
|
||||
Die Zustandsmaschine lebt im Athena-Router. Das Dashboard und Chat-Clients wie
|
||||
Hermes sind nur Bedienoberflächen derselben API. Der zuletzt aktive LLM-Modus
|
||||
@@ -19,7 +23,7 @@ wird persistent gespeichert und beim Verlassen eines Spezialmodus wieder geladen
|
||||
## Bedienung
|
||||
|
||||
Im Athena-Dashboard stehen **LLM-Betrieb**, **Musikstudio**, **Audio trennen**,
|
||||
**Voice Studio** und **Voice Changer** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
|
||||
**Voice Studio**, **X-VC**, **Seed-VC** und **Applio / RVC** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
|
||||
|
||||
- **Original UI · stabil** öffnet die zum laufenden ACE-Step-Image gehörende
|
||||
Gradio-Oberfläche. Sie ist für Cover, Remix und erweiterte Workflows der
|
||||
@@ -71,6 +75,16 @@ des verwendeten GLM-4-Voice-Tokenizers ist Chinesisch und Englisch; Deutsch
|
||||
bleibt deshalb bis zur Hörabnahme ein Qualitätstest und kein zugesagter
|
||||
Produktionspfad. X-VC läuft ausschließlich auf der RTX 5080.
|
||||
|
||||
Seed-VC ist unter `http://192.168.1.212:8010` erreichbar. Die gepinnte V1-
|
||||
Oberfläche unterstützt Zero-Shot-Sprach- und Gesangswandlung. Der Code ist auf
|
||||
den archivierten Upstream-Commit `51383efd921027683c89e5348211d93ff12ac2a8`
|
||||
fixiert; Gewichte werden beim ersten Auftrag persistent zwischengespeichert.
|
||||
|
||||
Applio ist unter `http://192.168.1.212:8011` erreichbar. Der RVC-Pfad besitzt
|
||||
eine eigene Modellbibliothek, Inferenz und Training. Hochwertige Inferenz
|
||||
benötigt ein passendes RVC-Stimmenmodell. Der Code ist auf Commit
|
||||
`7fa68ec2166ab1331c539704159fa14901e94e5a` fixiert.
|
||||
|
||||
Hermes benötigt dafür kein Plugin. Exakt eingegebene Steuerbefehle werden vom
|
||||
Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:
|
||||
|
||||
@@ -79,6 +93,8 @@ Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:
|
||||
/athena stems
|
||||
/athena voice
|
||||
/athena voicechange
|
||||
/athena seedvc
|
||||
/athena applio
|
||||
/athena llm
|
||||
/athena status
|
||||
```
|
||||
@@ -91,6 +107,8 @@ POST /mode {"mode":"music"}
|
||||
POST /mode {"mode":"separation"}
|
||||
POST /mode {"mode":"voice"}
|
||||
POST /mode {"mode":"voicechange"}
|
||||
POST /mode {"mode":"seedvc"}
|
||||
POST /mode {"mode":"applio"}
|
||||
POST /mode {"mode":"llm"}
|
||||
```
|
||||
|
||||
@@ -99,7 +117,9 @@ Der Wechsel läuft asynchron. Fortschritt und Fehler stehen unter `mode` in
|
||||
`com.mike-ai.music-worker=acestep` beziehungsweise
|
||||
`com.mike-ai.stem-separator=bs-roformer` oder
|
||||
`com.mike-ai.voice-worker=vevo2` beziehungsweise
|
||||
`com.mike-ai.voice-change-worker=xvc` markierten Container; freie
|
||||
`com.mike-ai.voice-change-worker=xvc`,
|
||||
`com.mike-ai.seed-vc-worker=seed-vc` oder
|
||||
`com.mike-ai.applio-worker=applio` markierten Container; freie
|
||||
Container- oder Docker-Befehle werden nicht entgegengenommen.
|
||||
|
||||
## Wiederanlauf
|
||||
|
||||
@@ -61,6 +61,8 @@ Titelgenerierung und Kontextkompression in Hermes.
|
||||
| 09.09.2026 | `k2-fsa/OmniVoice` 0.2.1 | Offizielle Gradio-UI auf RTX 5080 gestartet; Modell plus Whisper-ASR belegen rund 3,7 GiB VRAM. `omnivoice-triton` 0.1.0 ist kompatibel im Image vorhanden, für den ersten Hörtest aber bewusst noch nicht aktiviert | **technischer Starttest bestanden**, Hörabnahme und Basis-vs.-Triton-Messung offen; Gewichte CC BY-NC und daher nur nichtkommerziell einsetzen |
|
||||
| 09.09.2026 | `chenxie95/X-VC`, Code `49df8c591eafc48b096e466d96f9839f9c0dd739`, UI-Basis `d761cd6421e85376b2656dfefd8471d7f35a42be` | Offizielles Beispiel Ende-zu-Ende gewandelt: 5,20 s Audio in 1,07 s (RTF 0,21), gültiges 16-kHz-Mono-PCM-WAV; Modell belegt rund 2,9 GiB auf der RTX 5080. GLM-4-Voice-Tokenizer dokumentiert Chinesisch und Englisch | **technischer Start- und Konvertierungstest bestanden**; deutsche Hörabnahme offen |
|
||||
| 09.09.2026 | Resemble Enhance 0.0.1, Modellrevision `4e3510ce4a8391159f665903544c5150bee7b2cb` | 14,56 s native X-VC-Ausgabe bei 16 kHz wurden auf der RTX 5080 in 3,55 s zu 44,1-kHz-PCM-WAV restauriert. 3,27 % der gemessenen Signalenergie lagen danach oberhalb 8 kHz; damit ist der Pfad keine bloße Neuabtastung. Wegen der alten Upstream-Pins läuft die reine Inferenz mit NumPy 1.26.4/SciPy 1.11.4 auf dem bestehenden Torch-2.8/CUDA-12.8-Unterbau | **technisch produktiv als optionaler A/B-Pfad**; Hörabnahme entscheidet, ob die rekonstruierten Höhen subjektiv besser oder künstlicher klingen |
|
||||
| 09.09.2026 | `Plachtaa/seed-vc` V1, Code `51383efd921027683c89e5348211d93ff12ac2a8` | Gepinntes CUDA-12.8-/Torch-2.7.1-Image auf RTX 5080 gestartet; offizielle Gradio-Oberfläche und Healthcheck antworten. Gewichte folgen beim ersten echten Auftrag in den persistenten Hugging-Face-Cache | **technischer Starttest bestanden**; Konvertierungs- und Hörtest offen |
|
||||
| 09.09.2026 | `IAHispano/Applio`, Code `7fa68ec2166ab1331c539704159fa14901e94e5a` | Gepinntes CUDA-12.8-fähiges Image auf RTX 5080 gestartet; vollständige Applio/RVC-Oberfläche antwortet. Rund 1,8 GiB Basisgewichte und die Konfiguration wurden persistent ausgelagert; kein Zielstimmenmodell vorinstalliert | **technischer Start- und Persistenztest bestanden**; Konvertierungstest mit einem ausgewählten RVC-Modell offen |
|
||||
|
||||
## Musikgenerierung
|
||||
|
||||
|
||||
Reference in new issue
Block a user