diff --git a/AGENTS.md b/AGENTS.md new file mode 100644 index 0000000..3c05b0f --- /dev/null +++ b/AGENTS.md @@ -0,0 +1,15 @@ +# Repository-Regeln für Modelltests + +- Vor jedem Download, Benchmark oder neuen Profil zuerst + `docs/TESTED_MODELS.md` vollständig prüfen. +- Ein bereits verworfenes oder ersetztes Artefakt nicht erneut testen, sofern + sich nicht mindestens Runtime, Hardware, Quantisierung oder Modellrevision + konkret geändert hat. Den neuen Grund im Testbericht festhalten. +- Nach jedem Modelltest `docs/TESTED_MODELS.md` im selben Commit aktualisieren: + Datum, exaktes Repository, exakter Dateiname beziehungsweise Ollama-Tag, + Quantisierung, Kontext, Ergebnis, Entscheidung und Belegpfad. +- Ein heruntergeladenes, aber nicht belastbar getestetes Modell als + `unvollständig` eintragen; nicht stillschweigend als verworfen behandeln. +- Verworfene Gewichte erst löschen, nachdem die entscheidenden Resultate + dauerhaft dokumentiert sind. + diff --git a/README.md b/README.md index c0a5aa9..0a66f1f 100644 --- a/README.md +++ b/README.md @@ -174,6 +174,7 @@ Der genaue Sicherungsumfang steht in [docs/RECOVERY.md](docs/RECOVERY.md). - [ATHENA.md](ATHENA.md) – kurze Betriebsanleitung - [docs/STANDARD_PROFILE_MATRIX.md](docs/STANDARD_PROFILE_MATRIX.md) – Profile +- [docs/TESTED_MODELS.md](docs/TESTED_MODELS.md) – zentrale Testhistorie und Sperrliste gegen Doppeltests - [docs/MCP_SERVERS.md](docs/MCP_SERVERS.md) – produktive Werkzeuge - [docs/RECOVERY.md](docs/RECOVERY.md) – Backup und Neuaufbau - [docs/FLUX_9B_BETA.md](docs/FLUX_9B_BETA.md) – 9B-Bildpfad, Test und Rollback diff --git a/docs/CURRENT_RUNTIME_NOTES.md b/docs/CURRENT_RUNTIME_NOTES.md index 1df6cb1..764cbd1 100644 --- a/docs/CURRENT_RUNTIME_NOTES.md +++ b/docs/CURRENT_RUNTIME_NOTES.md @@ -57,15 +57,14 @@ Alle Textprofile verwenden llama.cpp Build 10781, Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab Build 10751 verfügbare Korrektur für eine zwischenzeitliche MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war -Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, und bleibt über das alte -lokale Image `mike-ai/llama.cpp:b10718-fallback` als unmittelbarer -Rückfallpunkt erhalten. +Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Dessen lokales +Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt; +ein Rückfall erfordert daher einen Neubau dieses Commits. -Build 10781 wurde nach dem Bau produktiv verifiziert: Alle fünf -Profilcontainer verwenden dasselbe neue Image, ausschließlich Medium läuft, -Qwen Medium ist mit 160.000 Tokens Kontext gesund, der MTP-Kontext wurde -erfolgreich initialisiert, der Vision-Projektor geladen und eine lokale -Textprobe korrekt beantwortet. +Build 10781 wurde nach dem Bau produktiv verifiziert. Alle sechs +Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra +mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden +erfolgreich geprüft. ## Qwen Medium: Vision-Projektor wieder aktiviert diff --git a/docs/FLUX_9B_BETA.md b/docs/FLUX_9B_BETA.md index bdfbcf2..13561d2 100644 --- a/docs/FLUX_9B_BETA.md +++ b/docs/FLUX_9B_BETA.md @@ -128,12 +128,10 @@ nicht erneut installiert werden. Die versionierte Quellfassung liegt unter ## Rollback -Vor der Beta-Bereitstellung wurden auf Athena diese Rückfall-Images angelegt: - -```text -mike-ai/image-worker:4b-rollback-20260907 -mike-ai/profile-controller:rollback-20260907 -``` +Die lokalen 4B-Gewichte und die kurzfristigen Rückfall-Images wurden am +8. September 2026 nach erfolgreicher 9B-Abnahme gezielt entfernt. Ein Rollback +auf 4B ist deshalb weiterhin reproduzierbar, aber nicht mehr unmittelbar: Das +4B-Modell muss erneut geladen und die ältere Stack-Fassung neu gebaut werden. Die zugehörige Deployment-Sicherung liegt auf Athena unter: diff --git a/docs/TESTED_MODELS.md b/docs/TESTED_MODELS.md new file mode 100644 index 0000000..01ec01c --- /dev/null +++ b/docs/TESTED_MODELS.md @@ -0,0 +1,70 @@ +# Register getesteter Modelle + +Stand: 8. September 2026 + +Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor +jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und +Quantisierung hier geprüft werden. Unterschiedliche Quantisierungen desselben +Basismodells gelten als eigene Kandidaten. + +Statuswerte: + +- **produktiv**: wird von mindestens einem regulären Profil verwendet +- **Beta**: bleibt gezielt verfügbar, ersetzt aber nicht den Standard +- **verworfen**: getestet und ohne ausreichenden Gesamtvorteil +- **ersetzt**: früher genutzt oder getestet, inzwischen abgelöst +- **unvollständig**: Artefakt vorbereitet, aber kein belastbarer Abnahmetest + +## Textmodelle auf Athena + +| Datum | Exaktes Modell beziehungsweise Artefakt | Kontext im Test | Ergebnis | Status / Entscheidung | Beleg | +|---|---|---:|---|---|---| +| 22.08.2026 | `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF` / `qwen3.8-27b-IQ4_XS-pure.gguf` | 160K–262K | beste ausgewogene Q4-Referenz; Langkontext, Tool-Call und Vision geprüft | **produktiv** für Medium, Large und Ultra | `benchmarks/qwen38-final-pre-move-20260822/` | +| 22.08.2026 | `vmarcelo/Qwen3.8-27B-MIX_GGUF` / `Qwen3.8-27B-IQ4-MIX.gguf` | 76,8K | schnellstes vollständig auf der RTX 5080 liegendes Q4-Profil | **produktiv** für Fast | `benchmarks/qwen38-final-pre-move-20260822/` | +| 22.08.2026 | Qwen3.8-27B NVFP4 `Q4_K_M` mit eingebettetem beziehungsweise separatem MTP | 72K | eingebettete Variante scheiterte beim Laden; Split-MTP lief, bot aber keinen ausreichenden Vorteil | **verworfen** | `benchmarks/qwen38-final-pre-move-20260822/qwen38-final-acceptance-20260822/` | +| 22.08.2026 | `Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF` / `Q4_K_M` | 80K | stabiler Spezialpfad mit Vision und MTP2 | **produktiv** für Uncensored | `benchmarks/qwen38-final-pre-move-20260822/qwen38-abliterated-final-20260822/` | +| 01.09.2026 | `peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF` / `UD-Q4_K_XL` | 80K–262K | korrekt und teils knapper, bei 160K aber 29–38 % langsamer im Decode als Pure | **verworfen** | [DIRK_QWEN38_AB_20260901.md](DIRK_QWEN38_AB_20260901.md) | +| 04.09.2026 | ISTA-DASLab Qwen3.8-27B GSQ-RCO `IQ3_XXS-MTP` | bis 196.608 | sehr platzsparend und bis 196.608 technisch lauffähig; später durch IQ3_S ersetzt | **ersetzt** | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) | +| 07.09.2026 | `Jackrong/Qwopus3.8-27B-Flash-GGUF` / `Qwopus3.8-27B-Flash-MTP-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 87,2 statt 105,3 Token/s, Lang-Decode 51,0 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` | +| 07.09.2026 | `bartowski/Qwen3.8-27B-GGUF` / `Qwen3.8-27B-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 90,4 statt 105,3 Token/s, Lang-Decode 51,9 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` | +| 08.09.2026 | `ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF` / `IQ3_S-MTP` | 76,8K–262K | Qualität im lokalen Test praktisch gleich, trotz optimierter GPU-Splits überwiegend langsamer als Q4 | **Beta** mit 112K; kein Ersatz für Q4 | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) | +| 08.09.2026 | `Tiel-Coder-35B-A3B-UD-IQ4_XS.gguf` | 160K vorgesehen | Testcontainer und Gewichte vorhanden gewesen, aber kein versionierter, belastbarer Abnahmebericht | **unvollständig**; nicht als getesteter Sieger behandeln | kein Ergebnisartefakt vorhanden | + +## Externe CPU-Helfermodelle + +Diese Versuche liefen nicht als Athena-Hauptprofil, sind aber relevant für +Titelgenerierung und Kontextkompression in Hermes. + +| Datum | Modell | Beobachtung | Entscheidung | +|---|---|---|---| +| 06.09.2026 | Ollama `qwen3:8b` | ungefähr 8,5–9,2 Token/s auf dem alten Dual-Xeon-Server | technisch brauchbar, aber für synchrone Hermes-Hilfsaufrufe langsam | +| 06.09.2026 | Ollama `gemma4:e4b` Q4 | ungefähr 4,7 Token/s auf dem HP EliteDesk, 10,2 auf dem alten Dual-Xeon und 15,1 auf dem neueren Proxmox-Host; mit Thinking liefen Hilfsaufrufe in Hermes in den 30-s-Timeout | nur mit `think:false` sinnvoll; nicht produktiv als Hermes-Auxiliary belegt | + +## Bildmodelle und Restaurierung + +| Datum | Modell | Ergebnis | Status / Entscheidung | Beleg | +|---|---|---|---|---| +| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) | +| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue; produktiver Zwei-GPU-Pfad, derzeit auf 1024 × 1024 begrenzt | **produktiv als Beta** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) | +| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) | +| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) | + +## Sprache + +| Datum | Modell | Ergebnis | Status / Entscheidung | +|---|---|---|---| +| 05.09.2026 | Coqui XTTS v2 | deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie | **verworfen und entfernt** | +| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** mit Piper-Fallback | +| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich | **produktiv** | + +## Ablauf für zukünftige Kandidaten + +1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen. +2. Bei einem Treffer zuerst den vorhandenen Beleg lesen; kein erneuter Download + ohne einen konkret neuen Grund wie Runtime, Quantisierung oder Hardware. +3. Neue Tests isoliert gegen das aktuelle Produktionsmodell mit identischem + Kontext, KV-Cache, MTP, Sampling und Promptset ausführen. +4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und + Pfad zum Detailbericht ergänzen. +5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen. +