6.0 KiB
6.0 KiB
Register getesteter Modelle
Stand: 8. September 2026
Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und Quantisierung hier geprüft werden. Unterschiedliche Quantisierungen desselben Basismodells gelten als eigene Kandidaten.
Statuswerte:
- produktiv: wird von mindestens einem regulären Profil verwendet
- Beta: bleibt gezielt verfügbar, ersetzt aber nicht den Standard
- verworfen: getestet und ohne ausreichenden Gesamtvorteil
- ersetzt: früher genutzt oder getestet, inzwischen abgelöst
- unvollständig: Artefakt vorbereitet, aber kein belastbarer Abnahmetest
Textmodelle auf Athena
| Datum | Exaktes Modell beziehungsweise Artefakt | Kontext im Test | Ergebnis | Status / Entscheidung | Beleg |
|---|---|---|---|---|---|
| 22.08.2026 | jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF / qwen3.8-27b-IQ4_XS-pure.gguf |
160K–262K | beste ausgewogene Q4-Referenz; Langkontext, Tool-Call und Vision geprüft | produktiv für Medium, Large und Ultra | benchmarks/qwen38-final-pre-move-20260822/ |
| 22.08.2026 | vmarcelo/Qwen3.8-27B-MIX_GGUF / Qwen3.8-27B-IQ4-MIX.gguf |
76,8K | schnellstes vollständig auf der RTX 5080 liegendes Q4-Profil | produktiv für Fast | benchmarks/qwen38-final-pre-move-20260822/ |
| 22.08.2026 | Qwen3.8-27B NVFP4 Q4_K_M mit eingebettetem beziehungsweise separatem MTP |
72K | eingebettete Variante scheiterte beim Laden; Split-MTP lief, bot aber keinen ausreichenden Vorteil | verworfen | benchmarks/qwen38-final-pre-move-20260822/qwen38-final-acceptance-20260822/ |
| 22.08.2026 | Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF / Q4_K_M |
80K | stabiler Spezialpfad mit Vision und MTP2 | produktiv für Uncensored | benchmarks/qwen38-final-pre-move-20260822/qwen38-abliterated-final-20260822/ |
| 01.09.2026 | peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF / UD-Q4_K_XL |
80K–262K | korrekt und teils knapper, bei 160K aber 29–38 % langsamer im Decode als Pure | verworfen | DIRK_QWEN38_AB_20260901.md |
| 04.09.2026 | ISTA-DASLab Qwen3.8-27B GSQ-RCO IQ3_XXS-MTP |
bis 196.608 | sehr platzsparend und bis 196.608 technisch lauffähig; später durch IQ3_S ersetzt | ersetzt | GSQ_RCO_BETA1_20260904.md |
| 07.09.2026 | Jackrong/Qwopus3.8-27B-Flash-GGUF / Qwopus3.8-27B-Flash-MTP-IQ4_XS.gguf |
160K | Recall 3/3; Decode 87,2 statt 105,3 Token/s, Lang-Decode 51,0 statt 56,7 Token/s; kein Gesamtvorteil | verworfen | Athena: /data/benchmarks/qwen38-ab-20260907/ |
| 07.09.2026 | bartowski/Qwen3.8-27B-GGUF / Qwen3.8-27B-IQ4_XS.gguf |
160K | Recall 3/3; Decode 90,4 statt 105,3 Token/s, Lang-Decode 51,9 statt 56,7 Token/s; kein Gesamtvorteil | verworfen | Athena: /data/benchmarks/qwen38-ab-20260907/ |
| 08.09.2026 | ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF / IQ3_S-MTP |
76,8K–262K | Qualität im lokalen Test praktisch gleich, trotz optimierter GPU-Splits überwiegend langsamer als Q4 | Beta mit 112K; kein Ersatz für Q4 | GSQ_RCO_BETA1_20260904.md |
| 08.09.2026 | Tiel-Coder-35B-A3B-UD-IQ4_XS.gguf |
160K vorgesehen | Testcontainer und Gewichte vorhanden gewesen, aber kein versionierter, belastbarer Abnahmebericht | unvollständig; nicht als getesteter Sieger behandeln | kein Ergebnisartefakt vorhanden |
Externe CPU-Helfermodelle
Diese Versuche liefen nicht als Athena-Hauptprofil, sind aber relevant für Titelgenerierung und Kontextkompression in Hermes.
| Datum | Modell | Beobachtung | Entscheidung |
|---|---|---|---|
| 06.09.2026 | Ollama qwen3:8b |
ungefähr 8,5–9,2 Token/s auf dem alten Dual-Xeon-Server | technisch brauchbar, aber für synchrone Hermes-Hilfsaufrufe langsam |
| 06.09.2026 | Ollama gemma4:e4b Q4 |
ungefähr 4,7 Token/s auf dem HP EliteDesk, 10,2 auf dem alten Dual-Xeon und 15,1 auf dem neueren Proxmox-Host; mit Thinking liefen Hilfsaufrufe in Hermes in den 30-s-Timeout | nur mit think:false sinnvoll; nicht produktiv als Hermes-Auxiliary belegt |
Bildmodelle und Restaurierung
| Datum | Modell | Ergebnis | Status / Entscheidung | Beleg |
|---|---|---|---|---|
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | ersetzt durch 9B FP8 | FLUX_9B_BETA.md |
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue; produktiver Zwei-GPU-Pfad, derzeit auf 1024 × 1024 begrenzt | produktiv als Beta | FLUX_9B_BETA.md |
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | verworfen | IMAGE_RESTORATION.md |
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | verworfen | IMAGE_RESTORATION.md |
Sprache
| Datum | Modell | Ergebnis | Status / Entscheidung |
|---|---|---|---|
| 05.09.2026 | Coqui XTTS v2 | deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie | verworfen und entfernt |
| 05.09.2026 | Qwen/Qwen3-TTS-12Hz-1.7B-Base |
deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | produktiv mit Piper-Fallback |
| 06.–08.09.2026 | Whisper.cpp large-v3-turbo |
lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | produktiv |
Ablauf für zukünftige Kandidaten
- Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
- Bei einem Treffer zuerst den vorhandenen Beleg lesen; kein erneuter Download ohne einen konkret neuen Grund wie Runtime, Quantisierung oder Hardware.
- Neue Tests isoliert gegen das aktuelle Produktionsmodell mit identischem Kontext, KV-Cache, MTP, Sampling und Promptset ausführen.
- Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und Pfad zum Detailbericht ergänzen.
- Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.