Files
AI-Profile-Router/docs/SPECIALIZED_MODEL_ROADMAP.md
T

61 lines
3.7 KiB
Markdown

# Roadmap fuer spezialisierte lokale KI-Dienste
Stand: 8. September 2026
Diese Liste sammelt Nischenmodelle, die wir auf Athena nacheinander testen.
Ein Eintrag ist erst produktiv, wenn er auf der realen Hardware abgenommen und
im zentralen Register `TESTED_MODELS.md` dokumentiert wurde.
| Prioritaet | Aufgabe | Kandidat | Geplanter Betrieb | Status |
|---:|---|---|---|---|
| 1 | Musik erzeugen und bearbeiten | `ACE-Step 1.5 XL SFT` mit `acestep-5Hz-lm-1.7B` | exklusives On-Demand-Profil auf der RTX 5080; CPU-Offload; Qwen, Vision und TTS werden waehrenddessen entladen | **integriert; Klangabnahme laeuft** |
| 2 | Gesang und Instrumente trennen | BS-RoFormer Viperx 1297, `ep_317` | exklusiver Audio-Worker auf der RTX 5080; FLAC-Ausgabe; eigener Dashboard-Modus | **integriert; Qualitätstest läuft** |
| 3 | Voice Cloning | vorhandenes `Qwen3-TTS-12Hz-1.7B-Base` | bestehender TTS-Worker auf der RTX 3060; zunaechst den eingebauten 3-Sekunden-Klonpfad freilegen | offen |
| 4 | Objekte lokalisieren und zaehlen | Grounding DINO oder RF-DETR | optionaler Vision-Worker; normales Erkennen bleibt beim vorhandenen Qwen-Vision-Projektor | offen |
| 5 | Bildort schaetzen | GeoAgent 8B | exklusives Vision-Profil; Ergebnis nur als Wahrscheinlichkeitsrangliste | offen |
| 6 | Eigene Orte/Bilder wiederfinden | AnyLoc oder GME-Qwen2-VL-7B | Embedding-Index mit eigener Referenzdatenbank | offen |
## Grundsaetze
- Qualitaet geht vor Dauerbetrieb: schwere Spezialmodelle duerfen die regulaeren
Profile voruebergehend entladen.
- Die RTX 5080 und RTX 3060 besitzen zusammen 28 GiB physischen VRAM, bilden
aber keinen gemeinsamen Speicherpool. Mehrkartenbetrieb muss vom jeweiligen
Modell beziehungsweise Backend ausdruecklich unterstuetzt werden.
- Jeder Test bleibt isoliert und entfernbar. Abgelehnte Images, Gewichte, Caches
und Integrationsreste werden nach der Dokumentation entfernt.
- Neue Kandidaten werden vor dem Download mit `TESTED_MODELS.md` abgeglichen.
## Erster Test: ACE-Step 1.5 XL SFT
Der erste Durchlauf nutzt nur die RTX 5080. Laut offiziellem Projekt benoetigt
XL mindestens 12 GiB mit Offload und empfiehlt mindestens 20 GiB ohne Offload.
Auf der 16-GiB-5080 wird deshalb der offiziell vorgesehene Offload-Pfad mit dem
1,7B-Musikplaner getestet. Die 3060 bleibt zunaechst frei; eine Verteilung ueber
beide Karten wird erst erwogen, wenn ACE-Step dafuer einen belastbaren
Inferenzpfad anbietet.
Abnahmekriterien:
1. Dienst startet reproduzierbar und belegt keine GPU im Ruhezustand.
2. Ein 30-Sekunden-Stueck wird ohne OOM erzeugt.
3. Laufzeit, Spitzen-VRAM, RAM-Nutzung und Ausgabedatei werden protokolliert.
4. Danach werden Ultra und TTS wiederhergestellt.
5. Erst nach bestandener Abnahme folgt die Hermes-Integration.
Erster Messlauf am 8. September 2026: Ein 30-Sekunden-Instrumental wurde in
15,39 Sekunden erzeugt (LM 8,00 s, DiT 7,39 s, MP3-Encoding 0,82 s). Die
gemeldete maximale CUDA-Allokation lag bei 9,38 GiB. Es gab weder OOM noch
CUDA-Fehler. Der technische Test ist damit bestanden; die subjektive
Die originale ACE-Step-Gradio-Oberflaeche ist der stabile Produktionspfad. Die
persistente `fspecii/ace-step-ui`-Oberflaeche bleibt bis zur Abnahme aller
Audio-zu-Audio-Modi experimentell. Der lokale Backport des offenen Upstream-PR
[#109](https://github.com/fspecii/ace-step-ui/pull/109) wurde gegen die 72
Parameter des live veroeffentlichten `/generation_wrapper`-Schemas getestet.
Ein zehnsekündiger FLAC-Textauftrag lief am 8. September 2026 erfolgreich durch
UI, Express-Backend und Gradio-API und wurde in der persistenten Bibliothek
gespeichert; dieser Test belegt Cover und Remix ausdrücklich noch nicht.
Offizielle Referenzen: [ACE-Step 1.5](https://github.com/ace-step/ACE-Step-1.5)
und [REST-API](https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/en/API.md).