# Roadmap fuer spezialisierte lokale KI-Dienste Stand: 8. September 2026 Diese Liste sammelt Nischenmodelle, die wir auf Athena nacheinander testen. Ein Eintrag ist erst produktiv, wenn er auf der realen Hardware abgenommen und im zentralen Register `TESTED_MODELS.md` dokumentiert wurde. | Prioritaet | Aufgabe | Kandidat | Geplanter Betrieb | Status | |---:|---|---|---|---| | 1 | Musik erzeugen und bearbeiten | `ACE-Step 1.5 XL SFT` mit `acestep-5Hz-lm-1.7B` | exklusives On-Demand-Profil auf der RTX 5080; CPU-Offload; Qwen, Vision und TTS werden waehrenddessen entladen | **technisch bestanden; Klangabnahme und Integration offen** | | 2 | Gesang und Instrumente trennen | BS-RoFormer Viperx 1297; alternativ MelBand-RoFormer, fuer Mehrspur `htdemucs_ft` | eigener Audio-Worker; GPU bevorzugt, CPU als langsamer Fallback | offen | | 3 | Voice Cloning | vorhandenes `Qwen3-TTS-12Hz-1.7B-Base` | bestehender TTS-Worker auf der RTX 3060; zunaechst den eingebauten 3-Sekunden-Klonpfad freilegen | offen | | 4 | Objekte lokalisieren und zaehlen | Grounding DINO oder RF-DETR | optionaler Vision-Worker; normales Erkennen bleibt beim vorhandenen Qwen-Vision-Projektor | offen | | 5 | Bildort schaetzen | GeoAgent 8B | exklusives Vision-Profil; Ergebnis nur als Wahrscheinlichkeitsrangliste | offen | | 6 | Eigene Orte/Bilder wiederfinden | AnyLoc oder GME-Qwen2-VL-7B | Embedding-Index mit eigener Referenzdatenbank | offen | ## Grundsaetze - Qualitaet geht vor Dauerbetrieb: schwere Spezialmodelle duerfen die regulaeren Profile voruebergehend entladen. - Die RTX 5080 und RTX 3060 besitzen zusammen 28 GiB physischen VRAM, bilden aber keinen gemeinsamen Speicherpool. Mehrkartenbetrieb muss vom jeweiligen Modell beziehungsweise Backend ausdruecklich unterstuetzt werden. - Jeder Test bleibt isoliert und entfernbar. Abgelehnte Images, Gewichte, Caches und Integrationsreste werden nach der Dokumentation entfernt. - Neue Kandidaten werden vor dem Download mit `TESTED_MODELS.md` abgeglichen. ## Erster Test: ACE-Step 1.5 XL SFT Der erste Durchlauf nutzt nur die RTX 5080. Laut offiziellem Projekt benoetigt XL mindestens 12 GiB mit Offload und empfiehlt mindestens 20 GiB ohne Offload. Auf der 16-GiB-5080 wird deshalb der offiziell vorgesehene Offload-Pfad mit dem 1,7B-Musikplaner getestet. Die 3060 bleibt zunaechst frei; eine Verteilung ueber beide Karten wird erst erwogen, wenn ACE-Step dafuer einen belastbaren Inferenzpfad anbietet. Abnahmekriterien: 1. Dienst startet reproduzierbar und belegt keine GPU im Ruhezustand. 2. Ein 30-Sekunden-Stueck wird ohne OOM erzeugt. 3. Laufzeit, Spitzen-VRAM, RAM-Nutzung und Ausgabedatei werden protokolliert. 4. Danach werden Ultra und TTS wiederhergestellt. 5. Erst nach bestandener Abnahme folgt die Hermes-Integration. Erster Messlauf am 8. September 2026: Ein 30-Sekunden-Instrumental wurde in 15,39 Sekunden erzeugt (LM 8,00 s, DiT 7,39 s, MP3-Encoding 0,82 s). Die gemeldete maximale CUDA-Allokation lag bei 9,38 GiB. Es gab weder OOM noch CUDA-Fehler. Der technische Test ist damit bestanden; die subjektive Klangabnahme erfolgt ueber die geoeffnete Gradio-Oberflaeche. Offizielle Referenzen: [ACE-Step 1.5](https://github.com/ace-step/ACE-Step-1.5) und [REST-API](https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/en/API.md).