Files
AI-Profile-Router/docs/OPERATING_MODES.md
T

6.6 KiB

Athena-Betriebsmodi

Athena besitzt sieben gegenseitig exklusive Betriebsmodi:

  • llm: ein llama.cpp-Profil und Qwen3-TTS laufen; Spezialdienste sind gestoppt.
  • music: ACE-Step 1.5 XL-SFT läuft; alle LLM-, Bild-, TTS- und Separator-Worker sind gestoppt.
  • separation: BS-RoFormer und Demucs trennen Musikspuren; ClearVoice trennt Sprache von Hintergrundgeräuschen. LLM, Bild, TTS und ACE-Step sind gestoppt.
  • voice: OmniVoice erzeugt Sprache aus Text mit einer gewählten Referenzstimme. LLM, Bild, TTS, ACE-Step und Separator sind gestoppt.
  • voicechange: X-VC überträgt eine vorhandene Sprachaufnahme auf eine Referenzstimme und bewahrt dabei Inhalt und Timing. Alle anderen GPU-Dienste sind gestoppt.
  • seedvc: Seed-VC V1 wandelt Sprache oder Gesang ohne Training anhand einer Referenzaufnahme um. Alle anderen GPU-Dienste sind gestoppt.
  • applio: Applio stellt RVC-Inferenz, Modellverwaltung und Training bereit. Alle anderen GPU-Dienste sind gestoppt.

Die Zustandsmaschine lebt im Athena-Router. Das Dashboard und Chat-Clients wie Hermes sind nur Bedienoberflächen derselben API. Der zuletzt aktive LLM-Modus wird persistent gespeichert und beim Verlassen eines Spezialmodus wieder geladen.

Bedienung

Im Athena-Dashboard stehen LLM-Betrieb, Musikstudio, Audio trennen, Voice Studio, X-VC, Seed-VC und Applio / RVC bereit. Im Musikmodus werden zwei Oberflächen angeboten:

  • Original UI · stabil öffnet die zum laufenden ACE-Step-Image gehörende Gradio-Oberfläche. Sie ist für Cover, Remix und erweiterte Workflows der verbindliche Produktionspfad.
  • Community UI · experimentell öffnet fspecii/ace-step-ui. Die CPU-leichte React/Express-Anwendung hält Bibliothek, Playlists und Einstellungen in /data/music/ace-step-ui. Ein noch nicht übernommener Upstream-Kompatibilitätsfix für die aktuelle 72-Felder-Gradio-API ist lokal zurückportiert; normale Generierung funktioniert, Cover und Remix gelten bis zu eigenen Ende-zu-Ende-Tests weiterhin als experimentell.

Die Community-Oberfläche ist im WireGuard-Netz unter http://192.168.1.212:7861, die originale Gradio-Oberfläche unter http://192.168.1.212:7862 erreichbar. Beide Host-Ports bleiben zusätzlich auf 127.0.0.1 gebunden und werden auf der Universitäts-Schnittstelle nicht veröffentlicht. ace-step-ui ist reproduzierbar auf Commit a1fdf91829ec6f7b98844f80e323529cd155dbf2 fixiert und greift intern über das Docker-Netz mike-ai-music auf http://music-worker:7860 zu.

Im Trennmodus öffnet das Dashboard die private Athena-Oberfläche unter http://192.168.1.212:8007. Sie nimmt WAV, FLAC, MP3, M4A und weitere übliche Formate an. Gewählt wird die herauszulösende Quelle: Gesang, Schlagzeug, Bass, Gitarre, Piano, Sonstiges oder gereinigte Sprache. Das ZIP enthält genau diese Zielspur und eine zweite FLAC-Datei mit dem vollständigen Rest ohne die Zielspur. Gesang nutzt BS-RoFormer Viperx 1297, Schlagzeug/Bass htdemucs_ft und Gitarre/Piano/Sonstiges experimentell htdemucs_6s. „Sonstiges“ ist dessen gemischter other-Stem (unter anderem Synthesizer, Streicher, Bläser und Effekte), nicht eine reine Synthesizer-Spur. Sprache nutzt das 48-kHz-Modell MossFormer2_SE_48K; der Download enthält speech.flac und hintergrund-ohne-sprache.flac. Die Musiktrennung basiert auf audio-separator 0.47.0. Die ältere API-Auswahl kompletter 2-/4-/6-Stem-Sätze bleibt rückwärtskompatibel.

Das Voice Studio ist ausschließlich über den privaten WireGuard-Pfad unter http://192.168.1.212:8008 erreichbar. Referenzstimmen werden unter /data/voice/studio/profiles gespeichert. Die Oberfläche verlangt vor dem Speichern eine Bestätigung der Nutzungsberechtigung. OmniVoice gibt unkomprimiertes WAV aus und erzeugt Sprache aus Text; es verarbeitet keine bereits eingesprochene Quellaufnahme.

Der X-VC Voice Changer ist ausschließlich unter http://192.168.1.212:8009 erreichbar. Er nimmt eine Quellaufnahme und eine Referenzstimme an. Die Oberfläche behält immer das native 16-kHz-PCM-WAV und erzeugt auf Wunsch zusätzlich mit Resemble Enhance eine neural restaurierte 44,1-kHz-Fassung. Diese zweite Datei rekonstruiert fehlende Sprachbandbreite; sie stellt keine im 16-kHz-Signal tatsächlich erhaltenen Originaldetails wieder her und bleibt deshalb direkt mit dem nativen Ergebnis vergleichbar. Die dokumentierte Sprachbasis des verwendeten GLM-4-Voice-Tokenizers ist Chinesisch und Englisch; Deutsch bleibt deshalb bis zur Hörabnahme ein Qualitätstest und kein zugesagter Produktionspfad. X-VC läuft ausschließlich auf der RTX 5080.

Seed-VC ist unter http://192.168.1.212:8010 erreichbar. Die gepinnte V1- Oberfläche unterstützt Zero-Shot-Sprach- und Gesangswandlung. Der Code ist auf den archivierten Upstream-Commit 51383efd921027683c89e5348211d93ff12ac2a8 fixiert; Gewichte werden beim ersten Auftrag persistent zwischengespeichert.

Applio ist unter http://192.168.1.212:8011 erreichbar. Der RVC-Pfad besitzt eine eigene Modellbibliothek, Inferenz und Training. Hochwertige Inferenz benötigt zwingend ein zuvor importiertes oder trainiertes RVC-Stimmenmodell (.pth, optional .index). Eine bloße Referenzaufnahme genügt bei Applio nicht. Der Code ist auf Commit 7fa68ec2166ab1331c539704159fa14901e94e5a fixiert.

Hermes benötigt dafür kein Plugin. Exakt eingegebene Steuerbefehle werden vom Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:

/athena music
/athena stems
/athena voice
/athena voicechange
/athena seedvc
/athena applio
/athena llm
/athena status

Die HTTP-Schnittstelle verwendet authentifizierte Requests:

GET  /mode
POST /mode  {"mode":"music"}
POST /mode  {"mode":"separation"}
POST /mode  {"mode":"voice"}
POST /mode  {"mode":"voicechange"}
POST /mode  {"mode":"seedvc"}
POST /mode  {"mode":"applio"}
POST /mode  {"mode":"llm"}

Der Wechsel läuft asynchron. Fortschritt und Fehler stehen unter mode in GET /status. Der Profile-Controller akzeptiert ausschließlich den mit com.mike-ai.music-worker=acestep beziehungsweise com.mike-ai.stem-separator=bs-roformer oder com.mike-ai.voice-worker=vevo2 beziehungsweise com.mike-ai.voice-change-worker=xvc, com.mike-ai.seed-vc-worker=seed-vc oder com.mike-ai.applio-worker=applio markierten Container; freie Container- oder Docker-Befehle werden nicht entgegengenommen.

Wiederanlauf

Der Router speichert mode, last_profile und return_profile atomar. War beim Router-Neustart ein Spezialmodus aktiv, startet er den passenden Worker erneut. Beim Wechsel zurück wird das gespeicherte LLM-Profil semantisch auf Alias und Kontextfenster geprüft, bevor Chat-Anfragen wieder freigegeben werden.