Add ACE-Step XL SFT music experiment
This commit is contained in:
@@ -0,0 +1,53 @@
|
||||
# Roadmap fuer spezialisierte lokale KI-Dienste
|
||||
|
||||
Stand: 8. September 2026
|
||||
|
||||
Diese Liste sammelt Nischenmodelle, die wir auf Athena nacheinander testen.
|
||||
Ein Eintrag ist erst produktiv, wenn er auf der realen Hardware abgenommen und
|
||||
im zentralen Register `TESTED_MODELS.md` dokumentiert wurde.
|
||||
|
||||
| Prioritaet | Aufgabe | Kandidat | Geplanter Betrieb | Status |
|
||||
|---:|---|---|---|---|
|
||||
| 1 | Musik erzeugen und bearbeiten | `ACE-Step 1.5 XL SFT` mit `acestep-5Hz-lm-1.7B` | exklusives On-Demand-Profil auf der RTX 5080; CPU-Offload; Qwen, Vision und TTS werden waehrenddessen entladen | **technisch bestanden; Klangabnahme und Integration offen** |
|
||||
| 2 | Gesang und Instrumente trennen | BS-RoFormer Viperx 1297; alternativ MelBand-RoFormer, fuer Mehrspur `htdemucs_ft` | eigener Audio-Worker; GPU bevorzugt, CPU als langsamer Fallback | offen |
|
||||
| 3 | Voice Cloning | vorhandenes `Qwen3-TTS-12Hz-1.7B-Base` | bestehender TTS-Worker auf der RTX 3060; zunaechst den eingebauten 3-Sekunden-Klonpfad freilegen | offen |
|
||||
| 4 | Objekte lokalisieren und zaehlen | Grounding DINO oder RF-DETR | optionaler Vision-Worker; normales Erkennen bleibt beim vorhandenen Qwen-Vision-Projektor | offen |
|
||||
| 5 | Bildort schaetzen | GeoAgent 8B | exklusives Vision-Profil; Ergebnis nur als Wahrscheinlichkeitsrangliste | offen |
|
||||
| 6 | Eigene Orte/Bilder wiederfinden | AnyLoc oder GME-Qwen2-VL-7B | Embedding-Index mit eigener Referenzdatenbank | offen |
|
||||
|
||||
## Grundsaetze
|
||||
|
||||
- Qualitaet geht vor Dauerbetrieb: schwere Spezialmodelle duerfen die regulaeren
|
||||
Profile voruebergehend entladen.
|
||||
- Die RTX 5080 und RTX 3060 besitzen zusammen 28 GiB physischen VRAM, bilden
|
||||
aber keinen gemeinsamen Speicherpool. Mehrkartenbetrieb muss vom jeweiligen
|
||||
Modell beziehungsweise Backend ausdruecklich unterstuetzt werden.
|
||||
- Jeder Test bleibt isoliert und entfernbar. Abgelehnte Images, Gewichte, Caches
|
||||
und Integrationsreste werden nach der Dokumentation entfernt.
|
||||
- Neue Kandidaten werden vor dem Download mit `TESTED_MODELS.md` abgeglichen.
|
||||
|
||||
## Erster Test: ACE-Step 1.5 XL SFT
|
||||
|
||||
Der erste Durchlauf nutzt nur die RTX 5080. Laut offiziellem Projekt benoetigt
|
||||
XL mindestens 12 GiB mit Offload und empfiehlt mindestens 20 GiB ohne Offload.
|
||||
Auf der 16-GiB-5080 wird deshalb der offiziell vorgesehene Offload-Pfad mit dem
|
||||
1,7B-Musikplaner getestet. Die 3060 bleibt zunaechst frei; eine Verteilung ueber
|
||||
beide Karten wird erst erwogen, wenn ACE-Step dafuer einen belastbaren
|
||||
Inferenzpfad anbietet.
|
||||
|
||||
Abnahmekriterien:
|
||||
|
||||
1. Dienst startet reproduzierbar und belegt keine GPU im Ruhezustand.
|
||||
2. Ein 30-Sekunden-Stueck wird ohne OOM erzeugt.
|
||||
3. Laufzeit, Spitzen-VRAM, RAM-Nutzung und Ausgabedatei werden protokolliert.
|
||||
4. Danach werden Ultra und TTS wiederhergestellt.
|
||||
5. Erst nach bestandener Abnahme folgt die Hermes-Integration.
|
||||
|
||||
Erster Messlauf am 8. September 2026: Ein 30-Sekunden-Instrumental wurde in
|
||||
15,39 Sekunden erzeugt (LM 8,00 s, DiT 7,39 s, MP3-Encoding 0,82 s). Die
|
||||
gemeldete maximale CUDA-Allokation lag bei 9,38 GiB. Es gab weder OOM noch
|
||||
CUDA-Fehler. Der technische Test ist damit bestanden; die subjektive
|
||||
Klangabnahme erfolgt ueber die geoeffnete Gradio-Oberflaeche.
|
||||
|
||||
Offizielle Referenzen: [ACE-Step 1.5](https://github.com/ace-step/ACE-Step-1.5)
|
||||
und [REST-API](https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/en/API.md).
|
||||
@@ -57,6 +57,12 @@ Titelgenerierung und Kontextkompression in Hermes.
|
||||
| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** mit Piper-Fallback |
|
||||
| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | **produktiv** |
|
||||
|
||||
## Musikgenerierung
|
||||
|
||||
| Datum | Modell | Test | Ergebnis | Status / Entscheidung | Beleg |
|
||||
|---|---|---|---|---|---|
|
||||
| 08.09.2026 | `ACE-Step/acestep-v15-xl-sft` mit `acestep-5Hz-lm-1.7B`, offizielles ACE-Step-1.5-Image `sha256:95652cd780c78a1b1a7f6f0335530430f0ae53d96c7c12d59f9f39fa23d38567` | 30 s Instrumental, Thinking/LM aktiv, Batch 1, RTX 5080 16 GiB, automatischer CPU-Offload und INT8 Weight-only DiT | erfolgreich in 15,39 s: LM 8,00 s, DiT 7,39 s, MP3 0,82 s; PyTorch meldete maximal 9,38 GiB CUDA-Allokation; kein OOM/CUDA-Fehler | **Beta-Test bestanden**; Klangabnahme und Hermes-/Router-Integration noch offen | Athena: `/data/music/acestep/batch_1788873234/`; [SPECIALIZED_MODEL_ROADMAP.md](SPECIALIZED_MODEL_ROADMAP.md) |
|
||||
|
||||
## Ablauf für zukünftige Kandidaten
|
||||
|
||||
1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
|
||||
@@ -67,4 +73,3 @@ Titelgenerierung und Kontextkompression in Hermes.
|
||||
4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und
|
||||
Pfad zum Detailbericht ergänzen.
|
||||
5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user