Add ACE-Step XL SFT music experiment

This commit is contained in:
Mikei386
2026-09-08 15:16:15 +02:00
parent 2724861224
commit 5e18b7776b
4 changed files with 135 additions and 1 deletions
+53
View File
@@ -0,0 +1,53 @@
# Roadmap fuer spezialisierte lokale KI-Dienste
Stand: 8. September 2026
Diese Liste sammelt Nischenmodelle, die wir auf Athena nacheinander testen.
Ein Eintrag ist erst produktiv, wenn er auf der realen Hardware abgenommen und
im zentralen Register `TESTED_MODELS.md` dokumentiert wurde.
| Prioritaet | Aufgabe | Kandidat | Geplanter Betrieb | Status |
|---:|---|---|---|---|
| 1 | Musik erzeugen und bearbeiten | `ACE-Step 1.5 XL SFT` mit `acestep-5Hz-lm-1.7B` | exklusives On-Demand-Profil auf der RTX 5080; CPU-Offload; Qwen, Vision und TTS werden waehrenddessen entladen | **technisch bestanden; Klangabnahme und Integration offen** |
| 2 | Gesang und Instrumente trennen | BS-RoFormer Viperx 1297; alternativ MelBand-RoFormer, fuer Mehrspur `htdemucs_ft` | eigener Audio-Worker; GPU bevorzugt, CPU als langsamer Fallback | offen |
| 3 | Voice Cloning | vorhandenes `Qwen3-TTS-12Hz-1.7B-Base` | bestehender TTS-Worker auf der RTX 3060; zunaechst den eingebauten 3-Sekunden-Klonpfad freilegen | offen |
| 4 | Objekte lokalisieren und zaehlen | Grounding DINO oder RF-DETR | optionaler Vision-Worker; normales Erkennen bleibt beim vorhandenen Qwen-Vision-Projektor | offen |
| 5 | Bildort schaetzen | GeoAgent 8B | exklusives Vision-Profil; Ergebnis nur als Wahrscheinlichkeitsrangliste | offen |
| 6 | Eigene Orte/Bilder wiederfinden | AnyLoc oder GME-Qwen2-VL-7B | Embedding-Index mit eigener Referenzdatenbank | offen |
## Grundsaetze
- Qualitaet geht vor Dauerbetrieb: schwere Spezialmodelle duerfen die regulaeren
Profile voruebergehend entladen.
- Die RTX 5080 und RTX 3060 besitzen zusammen 28 GiB physischen VRAM, bilden
aber keinen gemeinsamen Speicherpool. Mehrkartenbetrieb muss vom jeweiligen
Modell beziehungsweise Backend ausdruecklich unterstuetzt werden.
- Jeder Test bleibt isoliert und entfernbar. Abgelehnte Images, Gewichte, Caches
und Integrationsreste werden nach der Dokumentation entfernt.
- Neue Kandidaten werden vor dem Download mit `TESTED_MODELS.md` abgeglichen.
## Erster Test: ACE-Step 1.5 XL SFT
Der erste Durchlauf nutzt nur die RTX 5080. Laut offiziellem Projekt benoetigt
XL mindestens 12 GiB mit Offload und empfiehlt mindestens 20 GiB ohne Offload.
Auf der 16-GiB-5080 wird deshalb der offiziell vorgesehene Offload-Pfad mit dem
1,7B-Musikplaner getestet. Die 3060 bleibt zunaechst frei; eine Verteilung ueber
beide Karten wird erst erwogen, wenn ACE-Step dafuer einen belastbaren
Inferenzpfad anbietet.
Abnahmekriterien:
1. Dienst startet reproduzierbar und belegt keine GPU im Ruhezustand.
2. Ein 30-Sekunden-Stueck wird ohne OOM erzeugt.
3. Laufzeit, Spitzen-VRAM, RAM-Nutzung und Ausgabedatei werden protokolliert.
4. Danach werden Ultra und TTS wiederhergestellt.
5. Erst nach bestandener Abnahme folgt die Hermes-Integration.
Erster Messlauf am 8. September 2026: Ein 30-Sekunden-Instrumental wurde in
15,39 Sekunden erzeugt (LM 8,00 s, DiT 7,39 s, MP3-Encoding 0,82 s). Die
gemeldete maximale CUDA-Allokation lag bei 9,38 GiB. Es gab weder OOM noch
CUDA-Fehler. Der technische Test ist damit bestanden; die subjektive
Klangabnahme erfolgt ueber die geoeffnete Gradio-Oberflaeche.
Offizielle Referenzen: [ACE-Step 1.5](https://github.com/ace-step/ACE-Step-1.5)
und [REST-API](https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/en/API.md).
+6 -1
View File
@@ -57,6 +57,12 @@ Titelgenerierung und Kontextkompression in Hermes.
| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** mit Piper-Fallback |
| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | **produktiv** |
## Musikgenerierung
| Datum | Modell | Test | Ergebnis | Status / Entscheidung | Beleg |
|---|---|---|---|---|---|
| 08.09.2026 | `ACE-Step/acestep-v15-xl-sft` mit `acestep-5Hz-lm-1.7B`, offizielles ACE-Step-1.5-Image `sha256:95652cd780c78a1b1a7f6f0335530430f0ae53d96c7c12d59f9f39fa23d38567` | 30 s Instrumental, Thinking/LM aktiv, Batch 1, RTX 5080 16 GiB, automatischer CPU-Offload und INT8 Weight-only DiT | erfolgreich in 15,39 s: LM 8,00 s, DiT 7,39 s, MP3 0,82 s; PyTorch meldete maximal 9,38 GiB CUDA-Allokation; kein OOM/CUDA-Fehler | **Beta-Test bestanden**; Klangabnahme und Hermes-/Router-Integration noch offen | Athena: `/data/music/acestep/batch_1788873234/`; [SPECIALIZED_MODEL_ROADMAP.md](SPECIALIZED_MODEL_ROADMAP.md) |
## Ablauf für zukünftige Kandidaten
1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
@@ -67,4 +73,3 @@ Titelgenerierung und Kontextkompression in Hermes.
4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und
Pfad zum Detailbericht ergänzen.
5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.