Files
AI-Profile-Router/docs/TESTED_MODELS.md
2026-09-10 21:49:16 +02:00

12 KiB
Raw Permalink Blame History

Register getesteter Modelle

Stand: 10. September 2026

Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und Quantisierung hier geprüft werden. Unterschiedliche Quantisierungen desselben Basismodells gelten als eigene Kandidaten.

Statuswerte:

  • produktiv: wird von mindestens einem regulären Profil verwendet
  • Beta: bleibt gezielt verfügbar, ersetzt aber nicht den Standard
  • verworfen: getestet und ohne ausreichenden Gesamtvorteil
  • ersetzt: früher genutzt oder getestet, inzwischen abgelöst
  • unvollständig: Artefakt vorbereitet, aber kein belastbarer Abnahmetest

Textmodelle auf Athena

Datum Exaktes Modell beziehungsweise Artefakt Kontext im Test Ergebnis Status / Entscheidung Beleg
22.08.2026 jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF / qwen3.8-27b-IQ4_XS-pure.gguf 160K–262K beste ausgewogene Q4-Referenz; Langkontext, Tool-Call und Vision geprüft produktiv für Medium, Large und Ultra benchmarks/qwen38-final-pre-move-20260822/
22.08.2026 vmarcelo/Qwen3.8-27B-MIX_GGUF / Qwen3.8-27B-IQ4-MIX.gguf 76,8K schnellstes vollständig auf der RTX 5080 liegendes Q4-Profil produktiv für Fast benchmarks/qwen38-final-pre-move-20260822/
22.08.2026 Qwen3.8-27B NVFP4 Q4_K_M mit eingebettetem beziehungsweise separatem MTP 72K eingebettete Variante scheiterte beim Laden; Split-MTP lief, bot aber keinen ausreichenden Vorteil verworfen benchmarks/qwen38-final-pre-move-20260822/qwen38-final-acceptance-20260822/
22.08.2026 Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF / Q4_K_M 80K stabiler Spezialpfad mit Vision und MTP2 produktiv für Uncensored benchmarks/qwen38-final-pre-move-20260822/qwen38-abliterated-final-20260822/
01.09.2026 peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF / UD-Q4_K_XL 80K–262K korrekt und teils knapper, bei 160K aber 29–38 % langsamer im Decode als Pure verworfen DIRK_QWEN38_AB_20260901.md
04.09.2026 ISTA-DASLab Qwen3.8-27B GSQ-RCO IQ3_XXS-MTP bis 196.608 sehr platzsparend und bis 196.608 technisch lauffähig; später durch IQ3_S ersetzt ersetzt GSQ_RCO_BETA1_20260904.md
07.09.2026 Jackrong/Qwopus3.8-27B-Flash-GGUF / Qwopus3.8-27B-Flash-MTP-IQ4_XS.gguf 160K Recall 3/3; Decode 87,2 statt 105,3 Token/s, Lang-Decode 51,0 statt 56,7 Token/s; kein Gesamtvorteil verworfen Athena: /data/benchmarks/qwen38-ab-20260907/
07.09.2026 bartowski/Qwen3.8-27B-GGUF / Qwen3.8-27B-IQ4_XS.gguf 160K Recall 3/3; Decode 90,4 statt 105,3 Token/s, Lang-Decode 51,9 statt 56,7 Token/s; kein Gesamtvorteil verworfen Athena: /data/benchmarks/qwen38-ab-20260907/
08.09.2026 ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF / IQ3_S-MTP 76,8K–262K Qualität im lokalen Test praktisch gleich, trotz optimierter GPU-Splits überwiegend langsamer als Q4 entfernt; kein Ersatz für Q4 GSQ_RCO_BETA1_20260904.md
08.09.2026 Tiel-Coder-35B-A3B-UD-IQ4_XS.gguf 160K vorgesehen Testcontainer und Gewichte vorhanden gewesen, aber kein versionierter, belastbarer Abnahmebericht unvollständig; nicht als getesteter Sieger behandeln kein Ergebnisartefakt vorhanden

Externe CPU-Helfermodelle

Diese Versuche liefen nicht als Athena-Hauptprofil, sind aber relevant für Titelgenerierung und Kontextkompression in Hermes.

Datum Modell Beobachtung Entscheidung
06.09.2026 Ollama qwen3:8b ungefähr 8,5–9,2 Token/s auf dem alten Dual-Xeon-Server technisch brauchbar, aber für synchrone Hermes-Hilfsaufrufe langsam
06.09.2026 Ollama gemma4:e4b Q4 ungefähr 4,7 Token/s auf dem HP EliteDesk, 10,2 auf dem alten Dual-Xeon und 15,1 auf dem neueren Proxmox-Host; mit Thinking liefen Hilfsaufrufe in Hermes in den 30-s-Timeout nur mit think:false sinnvoll; nicht produktiv als Hermes-Auxiliary belegt

Bildmodelle und Restaurierung

Datum Modell Ergebnis Status / Entscheidung Beleg
bis 07.09.2026 FLUX.2 Klein 4B funktional, aber schwächere räumliche und motivische Konsistenz ersetzt durch 9B FP8 FLUX_9B_BETA.md
07.09.2026 FLUX.2 Klein 9B FP8 bessere Prompttreue; produktiver Zwei-GPU-Pfad, derzeit auf 1024 × 1024 begrenzt produktiv als Beta FLUX_9B_BETA.md
08.09.2026 HYPIR-SD2 glättete oder erfand Details und veränderte kleine Strukturen verworfen IMAGE_RESTORATION.md
08.09.2026 SeedVR2 7B FP8 bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück verworfen IMAGE_RESTORATION.md

Sprache

Datum Modell Ergebnis Status / Entscheidung
05.09.2026 Coqui XTTS v2 deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie verworfen und entfernt
05.09.2026 Qwen/Qwen3-TTS-12Hz-1.7B-Base deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen produktiv als einziges TTS-Backend
06.–08.09.2026 Whisper.cpp large-v3-turbo lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich; später zugunsten des kleineren Laufzeitmodells entfernt ersetzt
seit 03.09.2026 Whisper.cpp ggml-small tatsächlich im Compose-Stack und im laufenden Container verwendetes CPU-STT-Modell produktiv
09.09.2026 RMSnow/Vevo2, Amphion 26f6883110181f1dbfe95c70a7c7dbaf4de5f42a Technik und Geschwindigkeit funktionierten, reale deutsche Sprachwandlung mit kurzer und langer Referenz war jedoch unverständlich, halluzinierend oder musikalisch qualitativ verworfen und entfernt; Ergebnis bleibt hier dokumentiert, Images, Daten und altes Projekt wurden am 09.09. bereinigt
09.09.2026 k2-fsa/OmniVoice 0.2.1 Offizielle Gradio-UI auf RTX 5080 gestartet; Modell plus Whisper-ASR belegen rund 3,7 GiB VRAM. omnivoice-triton 0.1.0 ist kompatibel im Image vorhanden, für den ersten Hörtest aber bewusst noch nicht aktiviert technischer Starttest bestanden, Hörabnahme und Basis-vs.-Triton-Messung offen; Gewichte CC BY-NC und daher nur nichtkommerziell einsetzen
09.09.2026 chenxie95/X-VC, Code 49df8c591eafc48b096e466d96f9839f9c0dd739, UI-Basis d761cd6421e85376b2656dfefd8471d7f35a42be Offizielles Beispiel Ende-zu-Ende gewandelt: 5,20 s Audio in 1,07 s (RTF 0,21), gültiges 16-kHz-Mono-PCM-WAV; Modell belegt rund 2,9 GiB auf der RTX 5080. GLM-4-Voice-Tokenizer dokumentiert Chinesisch und Englisch technischer Start- und Konvertierungstest bestanden; deutsche Hörabnahme offen
09.09.2026 Resemble Enhance 0.0.1, Modellrevision 4e3510ce4a8391159f665903544c5150bee7b2cb 14,56 s native X-VC-Ausgabe bei 16 kHz wurden auf der RTX 5080 in 3,55 s zu 44,1-kHz-PCM-WAV restauriert. 3,27 % der gemessenen Signalenergie lagen danach oberhalb 8 kHz; damit ist der Pfad keine bloße Neuabtastung. Wegen der alten Upstream-Pins läuft die reine Inferenz mit NumPy 1.26.4/SciPy 1.11.4 auf dem bestehenden Torch-2.8/CUDA-12.8-Unterbau technisch produktiv als optionaler A/B-Pfad; Hörabnahme entscheidet, ob die rekonstruierten Höhen subjektiv besser oder künstlicher klingen
09.09.2026 Plachtaa/seed-vc V1, Code 51383efd921027683c89e5348211d93ff12ac2a8 Technisch vollständig lauffähig: gepinntes CUDA-Image, persistente Gewichte und reale WAV-Konvertierung mit etwa 3,6 GiB VRAM. Im deutschen Hörtest erhielt die Ausgabe jedoch einen deutlich chinesischen Akzent qualitativ verworfen und vollständig entfernt; nicht erneut für deutsche Sprachwandlung einplanen
09.09.2026 IAHispano/Applio, Code 7fa68ec2166ab1331c539704159fa14901e94e5a Gepinntes CUDA-12.8-fähiges Image auf RTX 5080 gestartet; vollständige Applio/RVC-Oberfläche antwortet und CUDA ist verfügbar. Rund 1,8 GiB Basisgewichte und die Konfiguration wurden persistent ausgelagert. Es ist kein Zielstimmenmodell installiert; Applio kann aus einer Referenzaufnahme allein kein Modell ableiten technischer Start- und Persistenztest bestanden; Konvertierung erst nach Import oder Training einer .pth-Stimme möglich

3D-Erzeugung

Datum Modell Test Ergebnis Status / Entscheidung Beleg
10.09.2026 TRELLIS.2 4B Q8, zehn GGUF-Komponenten, trellis.cpp 0.6.0 Bild-zu-3D bei 512, ausschließlich RTX 5080, Hintergrundentfernung auto, UV xatlas HTTP 200 nach 54,2 s; gültiges GLB 2 mit 4,4 MB; Container und Browseroberfläche gesund technisch integriert; 1024 ist der vorgesehene Qualitätsstandard, Druck- und subjektive Geometrieabnahme noch offen Athena: /opt/mike-ai/trellis-studio, Gewichte: /data/models/trellis2-q8

Musikgenerierung

Datum Modell Test Ergebnis Status / Entscheidung Beleg
08.–10.09.2026 ACE-Step/acestep-v15-xl-sft mit acestep-5Hz-lm-1.7B, offizielles ACE-Step-1.5-Image sha256:95652cd780c78a1b1a7f6f0335530430f0ae53d96c7c12d59f9f39fa23d38567 Mehrere Instrumentaltests bis 244 s; abschließender Kontrolllauf mit geladenem 1.7B-Planer, thinking=True, XL-SFT 4B, 80 Schritten, Guidance 8 und Shift 3 technisch vollständig und schnell, aber wiederholt nur Geräusche/Krach oder musikalisch chaotische Ergebnisse; der letzte Lauf schließt einen bloß fehlenden Planer als Ursache aus qualitativ verworfen; nicht als Qualitätslösung weiterverfolgen Athena: /data/music/acestep/; SPECIALIZED_MODEL_ROADMAP.md
10.09.2026 HeartMuLa/HeartMuLa-oss-3B-happy-new-year mit HeartMuLa/HeartCodec-oss-20260123, heartlib 3783bdb8441f2c298b1e64c8651173aac200361c Mehrere Instrumentalversuche mit offiziellen Samplingwerten; HeartMuLa BF16 auf RTX 5080, HeartCodec FP32 auf RTX 3060 technisch stabil und schnell, klanglich jedoch fast so unbrauchbar wie ACE-Step: Fantasiesprache trotz Instrumentalwunsch und gravierende Missachtung der Synthwave-/Synthpop-Stilvorgabe. Die lokale Test-UI hatte zusätzlich einen nicht upstream dokumentierten [Instrumental]-Marker verwendet qualitativ verworfen und vollständig entfernt; Container, Image, Gewichte und Ausgaben am 10.09.2026 gelöscht diese Tabelle; keine Laufzeitreste auf Athena
10.09.2026 m-a-p/YuE2-3B mit m-a-p/YuE2-Vae, offizieller Release yue2-v0.1.6 Unquantisiertes BF16 ausschließlich auf RTX 5080; leere Lyrics, expliziter Instrumentalstil, 118 BPM, Seed 831001 und vollständige symbolische Planung 189,5 s Musik in 83,8 s erzeugt; 48 kHz, Stereo, 24-Bit-FLAC, keine Kürzung und kein OOM. Der erste Hörtest war im deutlichen Gegensatz zu ACE-Step und HeartMuLa musikalisch überzeugend. Entstehung über neuen ABC-Plan, 4.739 semantische Tokens und neue akustische Latents verifiziert; keine mitgelieferte Demo-Datei technischer Test und erste Hörabnahme bestanden; isolierter Playground bereit, breitere Stil-/Gesangsprüfung und spätere Routerentscheidung noch offen yue2-3b; Athena: /data/music/yue2/instrumental_synthwave_control/

Audio-Trennung

Datum Modell Test Ergebnis Status / Entscheidung Beleg
08.09.2026 BS-RoFormer Viperx 1297, model_bs_roformer_ep_317_sdr_12.9755.ckpt, audio-separator 0.47.0 20-s-FLAC eines vorhandenen ACE-Step-Titels, RTX 5080, CUDA 12.8, ONNX Runtime GPU 1.22.0 zwei gültige FLAC-Spuren mit jeweils exakt 20,0 s; Verarbeitung 19 s; Vocal-Datei 1,45 MB, Instrumental-Datei 3,84 MB technischer Ende-zu-Ende-Test bestanden; Hörabnahme durch Nutzer offen bs-roformer-vocal-separation

Ablauf für zukünftige Kandidaten

  1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
  2. Bei einem Treffer zuerst den vorhandenen Beleg lesen; kein erneuter Download ohne einen konkret neuen Grund wie Runtime, Quantisierung oder Hardware.
  3. Neue Tests isoliert gegen das aktuelle Produktionsmodell mit identischem Kontext, KV-Cache, MTP, Sampling und Promptset ausführen.
  4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und Pfad zum Detailbericht ergänzen.
  5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.