Track tested models centrally

This commit is contained in:
Mikei386
2026-09-08 14:26:46 +02:00
parent 30fdbd4b7a
commit f1ed51a302
5 changed files with 97 additions and 14 deletions
+15
View File
@@ -0,0 +1,15 @@
# Repository-Regeln für Modelltests
- Vor jedem Download, Benchmark oder neuen Profil zuerst
`docs/TESTED_MODELS.md` vollständig prüfen.
- Ein bereits verworfenes oder ersetztes Artefakt nicht erneut testen, sofern
sich nicht mindestens Runtime, Hardware, Quantisierung oder Modellrevision
konkret geändert hat. Den neuen Grund im Testbericht festhalten.
- Nach jedem Modelltest `docs/TESTED_MODELS.md` im selben Commit aktualisieren:
Datum, exaktes Repository, exakter Dateiname beziehungsweise Ollama-Tag,
Quantisierung, Kontext, Ergebnis, Entscheidung und Belegpfad.
- Ein heruntergeladenes, aber nicht belastbar getestetes Modell als
`unvollständig` eintragen; nicht stillschweigend als verworfen behandeln.
- Verworfene Gewichte erst löschen, nachdem die entscheidenden Resultate
dauerhaft dokumentiert sind.
+1
View File
@@ -174,6 +174,7 @@ Der genaue Sicherungsumfang steht in [docs/RECOVERY.md](docs/RECOVERY.md).
- [ATHENA.md](ATHENA.md) – kurze Betriebsanleitung
- [docs/STANDARD_PROFILE_MATRIX.md](docs/STANDARD_PROFILE_MATRIX.md) – Profile
- [docs/TESTED_MODELS.md](docs/TESTED_MODELS.md) – zentrale Testhistorie und Sperrliste gegen Doppeltests
- [docs/MCP_SERVERS.md](docs/MCP_SERVERS.md) – produktive Werkzeuge
- [docs/RECOVERY.md](docs/RECOVERY.md) – Backup und Neuaufbau
- [docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md) – 9B-Bildpfad, Test und Rollback
+7 -8
View File
@@ -57,15 +57,14 @@ Alle Textprofile verwenden llama.cpp Build 10781,
Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab
Build 10751 verfügbare Korrektur für eine zwischenzeitliche
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, und bleibt über das alte
lokale Image `mike-ai/llama.cpp:b10718-fallback` als unmittelbarer
Rückfallpunkt erhalten.
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Dessen lokales
Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt;
ein Rückfall erfordert daher einen Neubau dieses Commits.
Build 10781 wurde nach dem Bau produktiv verifiziert: Alle fünf
Profilcontainer verwenden dasselbe neue Image, ausschließlich Medium läuft,
Qwen Medium ist mit 160.000 Tokens Kontext gesund, der MTP-Kontext wurde
erfolgreich initialisiert, der Vision-Projektor geladen und eine lokale
Textprobe korrekt beantwortet.
Build 10781 wurde nach dem Bau produktiv verifiziert. Alle sechs
Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra
mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden
erfolgreich geprüft.
## Qwen Medium: Vision-Projektor wieder aktiviert
+4 -6
View File
@@ -128,12 +128,10 @@ nicht erneut installiert werden. Die versionierte Quellfassung liegt unter
## Rollback
Vor der Beta-Bereitstellung wurden auf Athena diese Rückfall-Images angelegt:
```text
mike-ai/image-worker:4b-rollback-20260907
mike-ai/profile-controller:rollback-20260907
```
Die lokalen 4B-Gewichte und die kurzfristigen Rückfall-Images wurden am
8. September 2026 nach erfolgreicher 9B-Abnahme gezielt entfernt. Ein Rollback
auf 4B ist deshalb weiterhin reproduzierbar, aber nicht mehr unmittelbar: Das
4B-Modell muss erneut geladen und die ältere Stack-Fassung neu gebaut werden.
Die zugehörige Deployment-Sicherung liegt auf Athena unter:
+70
View File
@@ -0,0 +1,70 @@
# Register getesteter Modelle
Stand: 8. September 2026
Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor
jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und
Quantisierung hier geprüft werden. Unterschiedliche Quantisierungen desselben
Basismodells gelten als eigene Kandidaten.
Statuswerte:
- **produktiv**: wird von mindestens einem regulären Profil verwendet
- **Beta**: bleibt gezielt verfügbar, ersetzt aber nicht den Standard
- **verworfen**: getestet und ohne ausreichenden Gesamtvorteil
- **ersetzt**: früher genutzt oder getestet, inzwischen abgelöst
- **unvollständig**: Artefakt vorbereitet, aber kein belastbarer Abnahmetest
## Textmodelle auf Athena
| Datum | Exaktes Modell beziehungsweise Artefakt | Kontext im Test | Ergebnis | Status / Entscheidung | Beleg |
|---|---|---:|---|---|---|
| 22.08.2026 | `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF` / `qwen3.8-27b-IQ4_XS-pure.gguf` | 160K–262K | beste ausgewogene Q4-Referenz; Langkontext, Tool-Call und Vision geprüft | **produktiv** für Medium, Large und Ultra | `benchmarks/qwen38-final-pre-move-20260822/` |
| 22.08.2026 | `vmarcelo/Qwen3.8-27B-MIX_GGUF` / `Qwen3.8-27B-IQ4-MIX.gguf` | 76,8K | schnellstes vollständig auf der RTX 5080 liegendes Q4-Profil | **produktiv** für Fast | `benchmarks/qwen38-final-pre-move-20260822/` |
| 22.08.2026 | Qwen3.8-27B NVFP4 `Q4_K_M` mit eingebettetem beziehungsweise separatem MTP | 72K | eingebettete Variante scheiterte beim Laden; Split-MTP lief, bot aber keinen ausreichenden Vorteil | **verworfen** | `benchmarks/qwen38-final-pre-move-20260822/qwen38-final-acceptance-20260822/` |
| 22.08.2026 | `Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF` / `Q4_K_M` | 80K | stabiler Spezialpfad mit Vision und MTP2 | **produktiv** für Uncensored | `benchmarks/qwen38-final-pre-move-20260822/qwen38-abliterated-final-20260822/` |
| 01.09.2026 | `peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF` / `UD-Q4_K_XL` | 80K–262K | korrekt und teils knapper, bei 160K aber 29–38 % langsamer im Decode als Pure | **verworfen** | [DIRK_QWEN38_AB_20260901.md](DIRK_QWEN38_AB_20260901.md) |
| 04.09.2026 | ISTA-DASLab Qwen3.8-27B GSQ-RCO `IQ3_XXS-MTP` | bis 196.608 | sehr platzsparend und bis 196.608 technisch lauffähig; später durch IQ3_S ersetzt | **ersetzt** | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) |
| 07.09.2026 | `Jackrong/Qwopus3.8-27B-Flash-GGUF` / `Qwopus3.8-27B-Flash-MTP-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 87,2 statt 105,3 Token/s, Lang-Decode 51,0 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` |
| 07.09.2026 | `bartowski/Qwen3.8-27B-GGUF` / `Qwen3.8-27B-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 90,4 statt 105,3 Token/s, Lang-Decode 51,9 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` |
| 08.09.2026 | `ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF` / `IQ3_S-MTP` | 76,8K–262K | Qualität im lokalen Test praktisch gleich, trotz optimierter GPU-Splits überwiegend langsamer als Q4 | **Beta** mit 112K; kein Ersatz für Q4 | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) |
| 08.09.2026 | `Tiel-Coder-35B-A3B-UD-IQ4_XS.gguf` | 160K vorgesehen | Testcontainer und Gewichte vorhanden gewesen, aber kein versionierter, belastbarer Abnahmebericht | **unvollständig**; nicht als getesteter Sieger behandeln | kein Ergebnisartefakt vorhanden |
## Externe CPU-Helfermodelle
Diese Versuche liefen nicht als Athena-Hauptprofil, sind aber relevant für
Titelgenerierung und Kontextkompression in Hermes.
| Datum | Modell | Beobachtung | Entscheidung |
|---|---|---|---|
| 06.09.2026 | Ollama `qwen3:8b` | ungefähr 8,5–9,2 Token/s auf dem alten Dual-Xeon-Server | technisch brauchbar, aber für synchrone Hermes-Hilfsaufrufe langsam |
| 06.09.2026 | Ollama `gemma4:e4b` Q4 | ungefähr 4,7 Token/s auf dem HP EliteDesk, 10,2 auf dem alten Dual-Xeon und 15,1 auf dem neueren Proxmox-Host; mit Thinking liefen Hilfsaufrufe in Hermes in den 30-s-Timeout | nur mit `think:false` sinnvoll; nicht produktiv als Hermes-Auxiliary belegt |
## Bildmodelle und Restaurierung
| Datum | Modell | Ergebnis | Status / Entscheidung | Beleg |
|---|---|---|---|---|
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue; produktiver Zwei-GPU-Pfad, derzeit auf 1024 × 1024 begrenzt | **produktiv als Beta** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
## Sprache
| Datum | Modell | Ergebnis | Status / Entscheidung |
|---|---|---|---|
| 05.09.2026 | Coqui XTTS v2 | deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie | **verworfen und entfernt** |
| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** mit Piper-Fallback |
| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | **produktiv** |
## Ablauf für zukünftige Kandidaten
1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
2. Bei einem Treffer zuerst den vorhandenen Beleg lesen; kein erneuter Download
ohne einen konkret neuen Grund wie Runtime, Quantisierung oder Hardware.
3. Neue Tests isoliert gegen das aktuelle Produktionsmodell mit identischem
Kontext, KV-Cache, MTP, Sampling und Promptset ausführen.
4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und
Pfad zum Detailbericht ergänzen.
5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.