Document GSQ-RCO IQ3_S A-B results
This commit is contained in:
@@ -39,3 +39,27 @@ berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
|
||||
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
|
||||
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
|
||||
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
|
||||
|
||||
## Lokaler A/B-Test am 08.09.2026
|
||||
|
||||
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
|
||||
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
|
||||
|
||||
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|
||||
|---|---:|---:|
|
||||
| deterministische Kurzaufgaben | 24/25 | 24/25 |
|
||||
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
|
||||
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
|
||||
|
||||
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
|
||||
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
|
||||
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
|
||||
Langkontext-Benchmark.
|
||||
|
||||
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
|
||||
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
|
||||
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
|
||||
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
|
||||
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
|
||||
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
|
||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.
|
||||
|
||||
Reference in New Issue
Block a user