54 lines
3.2 KiB
Markdown
54 lines
3.2 KiB
Markdown
# Roadmap fuer spezialisierte lokale KI-Dienste
|
|
|
|
Stand: 8. September 2026
|
|
|
|
Diese Liste sammelt Nischenmodelle, die wir auf Athena nacheinander testen.
|
|
Ein Eintrag ist erst produktiv, wenn er auf der realen Hardware abgenommen und
|
|
im zentralen Register `TESTED_MODELS.md` dokumentiert wurde.
|
|
|
|
| Prioritaet | Aufgabe | Kandidat | Geplanter Betrieb | Status |
|
|
|---:|---|---|---|---|
|
|
| 1 | Musik erzeugen und bearbeiten | `ACE-Step 1.5 XL SFT` mit `acestep-5Hz-lm-1.7B` | exklusives On-Demand-Profil auf der RTX 5080; CPU-Offload; Qwen, Vision und TTS werden waehrenddessen entladen | **technisch bestanden; Klangabnahme und Integration offen** |
|
|
| 2 | Gesang und Instrumente trennen | BS-RoFormer Viperx 1297; alternativ MelBand-RoFormer, fuer Mehrspur `htdemucs_ft` | eigener Audio-Worker; GPU bevorzugt, CPU als langsamer Fallback | offen |
|
|
| 3 | Voice Cloning | vorhandenes `Qwen3-TTS-12Hz-1.7B-Base` | bestehender TTS-Worker auf der RTX 3060; zunaechst den eingebauten 3-Sekunden-Klonpfad freilegen | offen |
|
|
| 4 | Objekte lokalisieren und zaehlen | Grounding DINO oder RF-DETR | optionaler Vision-Worker; normales Erkennen bleibt beim vorhandenen Qwen-Vision-Projektor | offen |
|
|
| 5 | Bildort schaetzen | GeoAgent 8B | exklusives Vision-Profil; Ergebnis nur als Wahrscheinlichkeitsrangliste | offen |
|
|
| 6 | Eigene Orte/Bilder wiederfinden | AnyLoc oder GME-Qwen2-VL-7B | Embedding-Index mit eigener Referenzdatenbank | offen |
|
|
|
|
## Grundsaetze
|
|
|
|
- Qualitaet geht vor Dauerbetrieb: schwere Spezialmodelle duerfen die regulaeren
|
|
Profile voruebergehend entladen.
|
|
- Die RTX 5080 und RTX 3060 besitzen zusammen 28 GiB physischen VRAM, bilden
|
|
aber keinen gemeinsamen Speicherpool. Mehrkartenbetrieb muss vom jeweiligen
|
|
Modell beziehungsweise Backend ausdruecklich unterstuetzt werden.
|
|
- Jeder Test bleibt isoliert und entfernbar. Abgelehnte Images, Gewichte, Caches
|
|
und Integrationsreste werden nach der Dokumentation entfernt.
|
|
- Neue Kandidaten werden vor dem Download mit `TESTED_MODELS.md` abgeglichen.
|
|
|
|
## Erster Test: ACE-Step 1.5 XL SFT
|
|
|
|
Der erste Durchlauf nutzt nur die RTX 5080. Laut offiziellem Projekt benoetigt
|
|
XL mindestens 12 GiB mit Offload und empfiehlt mindestens 20 GiB ohne Offload.
|
|
Auf der 16-GiB-5080 wird deshalb der offiziell vorgesehene Offload-Pfad mit dem
|
|
1,7B-Musikplaner getestet. Die 3060 bleibt zunaechst frei; eine Verteilung ueber
|
|
beide Karten wird erst erwogen, wenn ACE-Step dafuer einen belastbaren
|
|
Inferenzpfad anbietet.
|
|
|
|
Abnahmekriterien:
|
|
|
|
1. Dienst startet reproduzierbar und belegt keine GPU im Ruhezustand.
|
|
2. Ein 30-Sekunden-Stueck wird ohne OOM erzeugt.
|
|
3. Laufzeit, Spitzen-VRAM, RAM-Nutzung und Ausgabedatei werden protokolliert.
|
|
4. Danach werden Ultra und TTS wiederhergestellt.
|
|
5. Erst nach bestandener Abnahme folgt die Hermes-Integration.
|
|
|
|
Erster Messlauf am 8. September 2026: Ein 30-Sekunden-Instrumental wurde in
|
|
15,39 Sekunden erzeugt (LM 8,00 s, DiT 7,39 s, MP3-Encoding 0,82 s). Die
|
|
gemeldete maximale CUDA-Allokation lag bei 9,38 GiB. Es gab weder OOM noch
|
|
CUDA-Fehler. Der technische Test ist damit bestanden; die subjektive
|
|
Klangabnahme erfolgt ueber die geoeffnete Gradio-Oberflaeche.
|
|
|
|
Offizielle Referenzen: [ACE-Step 1.5](https://github.com/ace-step/ACE-Step-1.5)
|
|
und [REST-API](https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/en/API.md).
|