Files
AI-Profile-Router/docs/OPERATING_MODES.md
T

4.6 KiB

Athena-Betriebsmodi

Athena besitzt vier gegenseitig exklusive Betriebsmodi:

  • llm: ein llama.cpp-Profil und Qwen3-TTS laufen; Spezialdienste sind gestoppt.
  • music: ACE-Step 1.5 XL-SFT läuft; alle LLM-, Bild-, TTS- und Separator-Worker sind gestoppt.
  • separation: BS-RoFormer und Demucs trennen Musikspuren; ClearVoice trennt Sprache von Hintergrundgeräuschen. LLM, Bild, TTS und ACE-Step sind gestoppt.
  • voice: Vevo2 überträgt Sprache oder Gesang auf eine gespeicherte Referenzstimme. LLM, Bild, TTS, ACE-Step und Separator sind gestoppt.

Die Zustandsmaschine lebt im Athena-Router. Das Dashboard und Chat-Clients wie Hermes sind nur Bedienoberflächen derselben API. Der zuletzt aktive LLM-Modus wird persistent gespeichert und beim Verlassen eines Spezialmodus wieder geladen.

Bedienung

Im Athena-Dashboard stehen LLM-Betrieb, Musikstudio, Audio trennen und Voice Studio bereit. Im Musikmodus werden zwei Oberflächen angeboten:

  • Original UI · stabil öffnet die zum laufenden ACE-Step-Image gehörende Gradio-Oberfläche. Sie ist für Cover, Remix und erweiterte Workflows der verbindliche Produktionspfad.
  • Community UI · experimentell öffnet fspecii/ace-step-ui. Die CPU-leichte React/Express-Anwendung hält Bibliothek, Playlists und Einstellungen in /data/music/ace-step-ui. Ein noch nicht übernommener Upstream-Kompatibilitätsfix für die aktuelle 72-Felder-Gradio-API ist lokal zurückportiert; normale Generierung funktioniert, Cover und Remix gelten bis zu eigenen Ende-zu-Ende-Tests weiterhin als experimentell.

Die Community-Oberfläche ist im WireGuard-Netz unter http://192.168.1.212:7861, die originale Gradio-Oberfläche unter http://192.168.1.212:7862 erreichbar. Beide Host-Ports bleiben zusätzlich auf 127.0.0.1 gebunden und werden auf der Universitäts-Schnittstelle nicht veröffentlicht. ace-step-ui ist reproduzierbar auf Commit a1fdf91829ec6f7b98844f80e323529cd155dbf2 fixiert und greift intern über das Docker-Netz mike-ai-music auf http://music-worker:7860 zu.

Im Trennmodus öffnet das Dashboard die private Athena-Oberfläche unter http://192.168.1.212:8007. Sie nimmt WAV, FLAC, MP3, M4A und weitere übliche Formate an. Gewählt wird die herauszulösende Quelle: Gesang, Schlagzeug, Bass, Gitarre, Piano, Sonstiges oder gereinigte Sprache. Das ZIP enthält genau diese Zielspur und eine zweite FLAC-Datei mit dem vollständigen Rest ohne die Zielspur. Gesang nutzt BS-RoFormer Viperx 1297, Schlagzeug/Bass htdemucs_ft und Gitarre/Piano/Sonstiges experimentell htdemucs_6s. „Sonstiges“ ist dessen gemischter other-Stem (unter anderem Synthesizer, Streicher, Bläser und Effekte), nicht eine reine Synthesizer-Spur. Sprache nutzt das 48-kHz-Modell MossFormer2_SE_48K; der Download enthält speech.flac und hintergrund-ohne-sprache.flac. Die Musiktrennung basiert auf audio-separator 0.47.0. Die ältere API-Auswahl kompletter 2-/4-/6-Stem-Sätze bleibt rückwärtskompatibel.

Das Voice Studio ist ausschließlich über den privaten WireGuard-Pfad unter http://192.168.1.212:8008 erreichbar. Referenzstimmen werden unter /data/voice/studio/profiles gespeichert. Die Oberfläche verlangt vor dem Speichern eine Bestätigung der Nutzungsberechtigung. Vevo2 gibt unkomprimiertes 24-kHz-WAV aus und wandelt sowohl Sprache als auch Gesang; dies ist noch kein Echtzeit-Live-Voice-Changer. Die Gewichte sind CC BY-NC-ND 4.0 lizenziert und werden auf Athena ausschließlich privat und nichtkommerziell eingesetzt.

Hermes benötigt dafür kein Plugin. Exakt eingegebene Steuerbefehle werden vom Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:

/athena music
/athena stems
/athena voice
/athena llm
/athena status

Die HTTP-Schnittstelle verwendet authentifizierte Requests:

GET  /mode
POST /mode  {"mode":"music"}
POST /mode  {"mode":"separation"}
POST /mode  {"mode":"voice"}
POST /mode  {"mode":"llm"}

Der Wechsel läuft asynchron. Fortschritt und Fehler stehen unter mode in GET /status. Der Profile-Controller akzeptiert ausschließlich den mit com.mike-ai.music-worker=acestep beziehungsweise com.mike-ai.stem-separator=bs-roformer oder com.mike-ai.voice-worker=vevo2 markierten Container; freie Container- oder Docker-Befehle werden nicht entgegengenommen.

Wiederanlauf

Der Router speichert mode, last_profile und return_profile atomar. War beim Router-Neustart ein Spezialmodus aktiv, startet er den passenden Worker erneut. Beim Wechsel zurück wird das gespeicherte LLM-Profil semantisch auf Alias und Kontextfenster geprüft, bevor Chat-Anfragen wieder freigegeben werden.