feat: add speech noise separation

This commit is contained in:
Mikei386 committed 2026-09-09 08:24:12 +02:00
1 parent 0fd1966ae3
commit 805228abfd
7 files changed
+135 -14

No files matched your search

@@ -15,6 +15,10 @@ Rest ohne dieses Ziel.
liegt unter der spezialisierten Gesangstrennung.
- **Sonstiges:** der `other`-Stem von `htdemucs_6s.yaml`. Er bündelt unter anderem
Synthesizer, Streicher, Bläser und Effekte und ist keine reine Synthesizer-Spur.
- **Sprache / Hintergrund:** ClearVoice `MossFormer2_SE_48K` (Apache-2.0)
verbessert Sprache bei 48 kHz. Die zweite Spur ist das vom Originalsignal
abgezogene Sprachsignal und enthält den verbleibenden Hintergrund. Stereo wird
kanalweise verarbeitet und anschließend wieder zusammengesetzt.
- GPU: RTX 5080; LLM, Bildmodelle, TTS und ACE-Step sind dabei verriegelt.
- Privat erreichbar: `http://192.168.1.212:8007/`
@@ -26,6 +30,6 @@ weitere Zielmodelle. Die Oberfläche bietet stattdessen den ehrlich benannten,
gemischten `other`-Stem als **Sonstiges** an.
Die API erwartet `multipart/form-data` mit `file` und optional `target`:
`vocals` (Standard), `drums`, `bass`, `guitar`, `piano` oder `other`. Das ältere Feld
`vocals` (Standard), `drums`, `bass`, `guitar`, `piano`, `other` oder `speech`. Das ältere Feld
`mode` mit `vocals`, `four_stem` oder `six_stem` bleibt für vorhandene Clients
erhalten und liefert weiterhin alle Modell-Stems.