From edb845eb191ff5604a3c679a6d7ce0e9c31c9aa5 Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Tue, 8 Sep 2026 12:10:08 +0200 Subject: [PATCH] Document GSQ-RCO IQ3_S A-B results --- docs/GSQ_RCO_BETA1_20260904.md | 24 ++++++++++++++++++++++++ 1 file changed, 24 insertions(+) diff --git a/docs/GSQ_RCO_BETA1_20260904.md b/docs/GSQ_RCO_BETA1_20260904.md index 293eaf7..a45aee6 100644 --- a/docs/GSQ_RCO_BETA1_20260904.md +++ b/docs/GSQ_RCO_BETA1_20260904.md @@ -39,3 +39,27 @@ berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben. + +## Lokaler A/B-Test am 08.09.2026 + +Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem +Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060. + +| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP | +|---|---:|---:| +| deterministische Kurzaufgaben | 24/25 | 24/25 | +| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s | +| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s | + +Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im +lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung +messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein +Langkontext-Benchmark. + +In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der +RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9 +Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080 +frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das +Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen +Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter +`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.