Document GSQ-RCO IQ3_S A-B results

This commit is contained in:
Mikei386
2026-09-08 12:10:08 +02:00
parent f7ff14a1ce
commit edb845eb19
+24
View File
@@ -39,3 +39,27 @@ berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben. Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
## Lokaler A/B-Test am 08.09.2026
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|---|---:|---:|
| deterministische Kurzaufgaben | 24/25 | 24/25 |
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
Langkontext-Benchmark.
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.