feat: add speech noise separation
This commit is contained in:
1 parent
0fd1966ae3
commit
805228abfd
7 files changed
+135
-14
No files matched your search
@@ -15,6 +15,10 @@ Rest ohne dieses Ziel.
|
||||
liegt unter der spezialisierten Gesangstrennung.
|
||||
- **Sonstiges:** der `other`-Stem von `htdemucs_6s.yaml`. Er bündelt unter anderem
|
||||
Synthesizer, Streicher, Bläser und Effekte und ist keine reine Synthesizer-Spur.
|
||||
- **Sprache / Hintergrund:** ClearVoice `MossFormer2_SE_48K` (Apache-2.0)
|
||||
verbessert Sprache bei 48 kHz. Die zweite Spur ist das vom Originalsignal
|
||||
abgezogene Sprachsignal und enthält den verbleibenden Hintergrund. Stereo wird
|
||||
kanalweise verarbeitet und anschließend wieder zusammengesetzt.
|
||||
- GPU: RTX 5080; LLM, Bildmodelle, TTS und ACE-Step sind dabei verriegelt.
|
||||
- Privat erreichbar: `http://192.168.1.212:8007/`
|
||||
|
||||
@@ -26,6 +30,6 @@ weitere Zielmodelle. Die Oberfläche bietet stattdessen den ehrlich benannten,
|
||||
gemischten `other`-Stem als **Sonstiges** an.
|
||||
|
||||
Die API erwartet `multipart/form-data` mit `file` und optional `target`:
|
||||
`vocals` (Standard), `drums`, `bass`, `guitar`, `piano` oder `other`. Das ältere Feld
|
||||
`vocals` (Standard), `drums`, `bass`, `guitar`, `piano`, `other` oder `speech`. Das ältere Feld
|
||||
`mode` mit `vocals`, `four_stem` oder `six_stem` bleibt für vorhandene Clients
|
||||
erhalten und liefert weiterhin alle Modell-Stems.
|
||||
Reference in new issue
Block a user