Track tested models centrally
This commit is contained in:
@@ -0,0 +1,15 @@
|
|||||||
|
# Repository-Regeln für Modelltests
|
||||||
|
|
||||||
|
- Vor jedem Download, Benchmark oder neuen Profil zuerst
|
||||||
|
`docs/TESTED_MODELS.md` vollständig prüfen.
|
||||||
|
- Ein bereits verworfenes oder ersetztes Artefakt nicht erneut testen, sofern
|
||||||
|
sich nicht mindestens Runtime, Hardware, Quantisierung oder Modellrevision
|
||||||
|
konkret geändert hat. Den neuen Grund im Testbericht festhalten.
|
||||||
|
- Nach jedem Modelltest `docs/TESTED_MODELS.md` im selben Commit aktualisieren:
|
||||||
|
Datum, exaktes Repository, exakter Dateiname beziehungsweise Ollama-Tag,
|
||||||
|
Quantisierung, Kontext, Ergebnis, Entscheidung und Belegpfad.
|
||||||
|
- Ein heruntergeladenes, aber nicht belastbar getestetes Modell als
|
||||||
|
`unvollständig` eintragen; nicht stillschweigend als verworfen behandeln.
|
||||||
|
- Verworfene Gewichte erst löschen, nachdem die entscheidenden Resultate
|
||||||
|
dauerhaft dokumentiert sind.
|
||||||
|
|
||||||
@@ -174,6 +174,7 @@ Der genaue Sicherungsumfang steht in [docs/RECOVERY.md](docs/RECOVERY.md).
|
|||||||
|
|
||||||
- [ATHENA.md](ATHENA.md) – kurze Betriebsanleitung
|
- [ATHENA.md](ATHENA.md) – kurze Betriebsanleitung
|
||||||
- [docs/STANDARD_PROFILE_MATRIX.md](docs/STANDARD_PROFILE_MATRIX.md) – Profile
|
- [docs/STANDARD_PROFILE_MATRIX.md](docs/STANDARD_PROFILE_MATRIX.md) – Profile
|
||||||
|
- [docs/TESTED_MODELS.md](docs/TESTED_MODELS.md) – zentrale Testhistorie und Sperrliste gegen Doppeltests
|
||||||
- [docs/MCP_SERVERS.md](docs/MCP_SERVERS.md) – produktive Werkzeuge
|
- [docs/MCP_SERVERS.md](docs/MCP_SERVERS.md) – produktive Werkzeuge
|
||||||
- [docs/RECOVERY.md](docs/RECOVERY.md) – Backup und Neuaufbau
|
- [docs/RECOVERY.md](docs/RECOVERY.md) – Backup und Neuaufbau
|
||||||
- [docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md) – 9B-Bildpfad, Test und Rollback
|
- [docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md) – 9B-Bildpfad, Test und Rollback
|
||||||
|
|||||||
@@ -57,15 +57,14 @@ Alle Textprofile verwenden llama.cpp Build 10781,
|
|||||||
Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab
|
Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab
|
||||||
Build 10751 verfügbare Korrektur für eine zwischenzeitliche
|
Build 10751 verfügbare Korrektur für eine zwischenzeitliche
|
||||||
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
|
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
|
||||||
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, und bleibt über das alte
|
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Dessen lokales
|
||||||
lokale Image `mike-ai/llama.cpp:b10718-fallback` als unmittelbarer
|
Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt;
|
||||||
Rückfallpunkt erhalten.
|
ein Rückfall erfordert daher einen Neubau dieses Commits.
|
||||||
|
|
||||||
Build 10781 wurde nach dem Bau produktiv verifiziert: Alle fünf
|
Build 10781 wurde nach dem Bau produktiv verifiziert. Alle sechs
|
||||||
Profilcontainer verwenden dasselbe neue Image, ausschließlich Medium läuft,
|
Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra
|
||||||
Qwen Medium ist mit 160.000 Tokens Kontext gesund, der MTP-Kontext wurde
|
mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden
|
||||||
erfolgreich initialisiert, der Vision-Projektor geladen und eine lokale
|
erfolgreich geprüft.
|
||||||
Textprobe korrekt beantwortet.
|
|
||||||
|
|
||||||
## Qwen Medium: Vision-Projektor wieder aktiviert
|
## Qwen Medium: Vision-Projektor wieder aktiviert
|
||||||
|
|
||||||
|
|||||||
@@ -128,12 +128,10 @@ nicht erneut installiert werden. Die versionierte Quellfassung liegt unter
|
|||||||
|
|
||||||
## Rollback
|
## Rollback
|
||||||
|
|
||||||
Vor der Beta-Bereitstellung wurden auf Athena diese Rückfall-Images angelegt:
|
Die lokalen 4B-Gewichte und die kurzfristigen Rückfall-Images wurden am
|
||||||
|
8. September 2026 nach erfolgreicher 9B-Abnahme gezielt entfernt. Ein Rollback
|
||||||
```text
|
auf 4B ist deshalb weiterhin reproduzierbar, aber nicht mehr unmittelbar: Das
|
||||||
mike-ai/image-worker:4b-rollback-20260907
|
4B-Modell muss erneut geladen und die ältere Stack-Fassung neu gebaut werden.
|
||||||
mike-ai/profile-controller:rollback-20260907
|
|
||||||
```
|
|
||||||
|
|
||||||
Die zugehörige Deployment-Sicherung liegt auf Athena unter:
|
Die zugehörige Deployment-Sicherung liegt auf Athena unter:
|
||||||
|
|
||||||
|
|||||||
@@ -0,0 +1,70 @@
|
|||||||
|
# Register getesteter Modelle
|
||||||
|
|
||||||
|
Stand: 8. September 2026
|
||||||
|
|
||||||
|
Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor
|
||||||
|
jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und
|
||||||
|
Quantisierung hier geprüft werden. Unterschiedliche Quantisierungen desselben
|
||||||
|
Basismodells gelten als eigene Kandidaten.
|
||||||
|
|
||||||
|
Statuswerte:
|
||||||
|
|
||||||
|
- **produktiv**: wird von mindestens einem regulären Profil verwendet
|
||||||
|
- **Beta**: bleibt gezielt verfügbar, ersetzt aber nicht den Standard
|
||||||
|
- **verworfen**: getestet und ohne ausreichenden Gesamtvorteil
|
||||||
|
- **ersetzt**: früher genutzt oder getestet, inzwischen abgelöst
|
||||||
|
- **unvollständig**: Artefakt vorbereitet, aber kein belastbarer Abnahmetest
|
||||||
|
|
||||||
|
## Textmodelle auf Athena
|
||||||
|
|
||||||
|
| Datum | Exaktes Modell beziehungsweise Artefakt | Kontext im Test | Ergebnis | Status / Entscheidung | Beleg |
|
||||||
|
|---|---|---:|---|---|---|
|
||||||
|
| 22.08.2026 | `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF` / `qwen3.8-27b-IQ4_XS-pure.gguf` | 160K–262K | beste ausgewogene Q4-Referenz; Langkontext, Tool-Call und Vision geprüft | **produktiv** für Medium, Large und Ultra | `benchmarks/qwen38-final-pre-move-20260822/` |
|
||||||
|
| 22.08.2026 | `vmarcelo/Qwen3.8-27B-MIX_GGUF` / `Qwen3.8-27B-IQ4-MIX.gguf` | 76,8K | schnellstes vollständig auf der RTX 5080 liegendes Q4-Profil | **produktiv** für Fast | `benchmarks/qwen38-final-pre-move-20260822/` |
|
||||||
|
| 22.08.2026 | Qwen3.8-27B NVFP4 `Q4_K_M` mit eingebettetem beziehungsweise separatem MTP | 72K | eingebettete Variante scheiterte beim Laden; Split-MTP lief, bot aber keinen ausreichenden Vorteil | **verworfen** | `benchmarks/qwen38-final-pre-move-20260822/qwen38-final-acceptance-20260822/` |
|
||||||
|
| 22.08.2026 | `Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF` / `Q4_K_M` | 80K | stabiler Spezialpfad mit Vision und MTP2 | **produktiv** für Uncensored | `benchmarks/qwen38-final-pre-move-20260822/qwen38-abliterated-final-20260822/` |
|
||||||
|
| 01.09.2026 | `peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF` / `UD-Q4_K_XL` | 80K–262K | korrekt und teils knapper, bei 160K aber 29–38 % langsamer im Decode als Pure | **verworfen** | [DIRK_QWEN38_AB_20260901.md](DIRK_QWEN38_AB_20260901.md) |
|
||||||
|
| 04.09.2026 | ISTA-DASLab Qwen3.8-27B GSQ-RCO `IQ3_XXS-MTP` | bis 196.608 | sehr platzsparend und bis 196.608 technisch lauffähig; später durch IQ3_S ersetzt | **ersetzt** | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) |
|
||||||
|
| 07.09.2026 | `Jackrong/Qwopus3.8-27B-Flash-GGUF` / `Qwopus3.8-27B-Flash-MTP-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 87,2 statt 105,3 Token/s, Lang-Decode 51,0 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` |
|
||||||
|
| 07.09.2026 | `bartowski/Qwen3.8-27B-GGUF` / `Qwen3.8-27B-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 90,4 statt 105,3 Token/s, Lang-Decode 51,9 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` |
|
||||||
|
| 08.09.2026 | `ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF` / `IQ3_S-MTP` | 76,8K–262K | Qualität im lokalen Test praktisch gleich, trotz optimierter GPU-Splits überwiegend langsamer als Q4 | **Beta** mit 112K; kein Ersatz für Q4 | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) |
|
||||||
|
| 08.09.2026 | `Tiel-Coder-35B-A3B-UD-IQ4_XS.gguf` | 160K vorgesehen | Testcontainer und Gewichte vorhanden gewesen, aber kein versionierter, belastbarer Abnahmebericht | **unvollständig**; nicht als getesteter Sieger behandeln | kein Ergebnisartefakt vorhanden |
|
||||||
|
|
||||||
|
## Externe CPU-Helfermodelle
|
||||||
|
|
||||||
|
Diese Versuche liefen nicht als Athena-Hauptprofil, sind aber relevant für
|
||||||
|
Titelgenerierung und Kontextkompression in Hermes.
|
||||||
|
|
||||||
|
| Datum | Modell | Beobachtung | Entscheidung |
|
||||||
|
|---|---|---|---|
|
||||||
|
| 06.09.2026 | Ollama `qwen3:8b` | ungefähr 8,5–9,2 Token/s auf dem alten Dual-Xeon-Server | technisch brauchbar, aber für synchrone Hermes-Hilfsaufrufe langsam |
|
||||||
|
| 06.09.2026 | Ollama `gemma4:e4b` Q4 | ungefähr 4,7 Token/s auf dem HP EliteDesk, 10,2 auf dem alten Dual-Xeon und 15,1 auf dem neueren Proxmox-Host; mit Thinking liefen Hilfsaufrufe in Hermes in den 30-s-Timeout | nur mit `think:false` sinnvoll; nicht produktiv als Hermes-Auxiliary belegt |
|
||||||
|
|
||||||
|
## Bildmodelle und Restaurierung
|
||||||
|
|
||||||
|
| Datum | Modell | Ergebnis | Status / Entscheidung | Beleg |
|
||||||
|
|---|---|---|---|---|
|
||||||
|
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||||
|
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue; produktiver Zwei-GPU-Pfad, derzeit auf 1024 × 1024 begrenzt | **produktiv als Beta** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||||
|
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||||
|
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||||
|
|
||||||
|
## Sprache
|
||||||
|
|
||||||
|
| Datum | Modell | Ergebnis | Status / Entscheidung |
|
||||||
|
|---|---|---|---|
|
||||||
|
| 05.09.2026 | Coqui XTTS v2 | deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie | **verworfen und entfernt** |
|
||||||
|
| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** mit Piper-Fallback |
|
||||||
|
| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | **produktiv** |
|
||||||
|
|
||||||
|
## Ablauf für zukünftige Kandidaten
|
||||||
|
|
||||||
|
1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
|
||||||
|
2. Bei einem Treffer zuerst den vorhandenen Beleg lesen; kein erneuter Download
|
||||||
|
ohne einen konkret neuen Grund wie Runtime, Quantisierung oder Hardware.
|
||||||
|
3. Neue Tests isoliert gegen das aktuelle Produktionsmodell mit identischem
|
||||||
|
Kontext, KV-Cache, MTP, Sampling und Promptset ausführen.
|
||||||
|
4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und
|
||||||
|
Pfad zum Detailbericht ergänzen.
|
||||||
|
5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.
|
||||||
|
|
||||||
Reference in New Issue
Block a user