36 lines
2.0 KiB
Markdown
36 lines
2.0 KiB
Markdown
# Athena Stem Separator
|
|
|
|
Exklusiver dritter Athena-Betriebsmodus zum gezielten Herauslösen einer Quelle.
|
|
Der Download enthält immer die Zielspur und eine zweite Spur mit dem kompletten
|
|
Rest ohne dieses Ziel.
|
|
|
|
- Engine: `audio-separator` 0.47.0 (MIT)
|
|
- **Gesang / Instrumental:** BS-RoFormer Viperx 1297,
|
|
`model_bs_roformer_ep_317_sdr_12.9755.ckpt`; Vocal SDR 12,9,
|
|
Instrumental SDR 17,0.
|
|
- **Schlagzeug oder Bass:** `htdemucs_ft.yaml`; die nicht gewählten Stems werden
|
|
zu einer gemeinsamen Restspur summiert.
|
|
- **Gitarre oder Piano (experimentell):** `htdemucs_6s.yaml`; auch hier werden
|
|
alle übrigen Stems wieder zur Restspur zusammengesetzt. Die Instrumentqualität
|
|
liegt unter der spezialisierten Gesangstrennung.
|
|
- **Sonstiges:** der `other`-Stem von `htdemucs_6s.yaml`. Er bündelt unter anderem
|
|
Synthesizer, Streicher, Bläser und Effekte und ist keine reine Synthesizer-Spur.
|
|
- **Sprache / Hintergrund:** ClearVoice `MossFormer2_SE_48K` (Apache-2.0)
|
|
verbessert Sprache bei 48 kHz. Die zweite Spur ist das vom Originalsignal
|
|
abgezogene Sprachsignal und enthält den verbleibenden Hintergrund. Stereo wird
|
|
kanalweise verarbeitet und anschließend wieder zusammengesetzt.
|
|
- GPU: RTX 5080; LLM, Bildmodelle, TTS und ACE-Step sind dabei verriegelt.
|
|
- Privat erreichbar: `http://192.168.1.212:8007/`
|
|
|
|
Die Modelle werden beim ersten Start nach `/data/models/audio-separator`
|
|
heruntergeladen. Temporäre Jobs liegen unter `/data/audio/separation` und
|
|
werden nach dem ZIP-Download entfernt. Eigene Spuren für E-/Akustikgitarre,
|
|
Synthesizer und Streicher sind bewusst noch nicht angeboten: Dafür braucht es
|
|
weitere Zielmodelle. Die Oberfläche bietet stattdessen den ehrlich benannten,
|
|
gemischten `other`-Stem als **Sonstiges** an.
|
|
|
|
Die API erwartet `multipart/form-data` mit `file` und optional `target`:
|
|
`vocals` (Standard), `drums`, `bass`, `guitar`, `piano`, `other` oder `speech`. Das ältere Feld
|
|
`mode` mit `vocals`, `four_stem` oder `six_stem` bleibt für vorhandene Clients
|
|
erhalten und liefert weiterhin alle Modell-Stems.
|