Document profile-wide GSQ-RCO A-B test
This commit is contained in:
@@ -63,3 +63,48 @@ frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
|
||||
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
|
||||
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
|
||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.
|
||||
|
||||
## Profilweiter A/B-Härtetest am 08.09.2026
|
||||
|
||||
Ein zweiter Test verglich GSQ-RCO IQ3_S mit den jeweils heute verwendeten
|
||||
Q4-Modellen unter den echten Kontext-, GPU-, MTP- und Batch-Einstellungen der
|
||||
Profile. Medium und Large luden dabei auch den Vision-Projektor auf der RTX
|
||||
3060; der dort bereits laufende TTS-Dienst blieb unangetastet. Alle acht
|
||||
Varianten fanden drei synthetische Nadeln bei 70 Prozent des jeweiligen
|
||||
Kontextfensters.
|
||||
|
||||
| Profil | Q4 kurzer Prefill | IQ3_S kurzer Prefill | Delta | Q4 Decode | IQ3_S Decode | Delta | Q4 Lang-Prefill | IQ3_S Lang-Prefill | Delta | Q4 Lang-Decode | IQ3_S Lang-Decode | Delta |
|
||||
|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|
|
||||
| Fast 76,8K | 938,2 | 860,5 | -8,3 % | 115,3 | 109,2 | -5,2 % | 816,7 | 757,4 | -7,3 % | 74,7 | 76,4 | +2,3 % |
|
||||
| Medium 160K | 1.449,7 | 1.342,3 | -7,4 % | 104,0 | 86,9 | -16,5 % | 948,3 | 897,3 | -5,4 % | 56,3 | 48,9 | -13,1 % |
|
||||
| Large 192K | 1.456,5 | 1.342,6 | -7,8 % | 104,3 | 86,9 | -16,7 % | 849,5 | 808,9 | -4,8 % | 52,2 | 45,5 | -12,8 % |
|
||||
| Ultra 262K | 1.728,3 | 1.288,2 | -25,5 % | 83,8 | 73,5 | -12,3 % | 808,2 | 677,8 | -16,1 % | 33,3 | 32,0 | -4,0 % |
|
||||
|
||||
Alle Geschwindigkeiten sind Token/s. `Fast` vergleicht das produktive
|
||||
IQ4-MIX mit IQ3_S; die übrigen Profile vergleichen IQ4_XS Pure mit IQ3_S.
|
||||
Die langen Prompts enthielten rund 53,8K, 112K, 134,5K beziehungsweise 183,6K
|
||||
synthetische Token.
|
||||
|
||||
Der komplexere Qualitätstest bestand aus neun deutschsprachigen Aufgaben zu
|
||||
Logik, evidenzgebundener Diagnose, nebenläufigem Python, Kapazitätsplanung,
|
||||
Prompt-Injection, Laufzeit- gegenüber Konfigurationszustand und sicherem
|
||||
Adminverhalten sowie einem nativen Tool-Call. Acht Aufgaben waren inhaltlich
|
||||
gleichwertig; beide Modelle hatten beim nebenläufigen Python-Code denselben
|
||||
subtilen Restfehler. Bei der Kapazitätsplanung ermittelten beide intern korrekt,
|
||||
dass die Migration unmöglich ist. Beide erreichten jedoch das 4K-Ausgabelimit:
|
||||
Q4 gab die Schlussfolgerung und fast den ganzen Beweis sichtbar aus, IQ3_S
|
||||
verbrauchte das Limit vollständig im Reasoning und lieferte keinen sichtbaren
|
||||
Antworttext. Beide nativen Tool-Calls waren korrekt.
|
||||
|
||||
Über alle neun Aufgaben benötigte Q4 223,0 Sekunden und IQ3_S 278,9 Sekunden;
|
||||
IQ3_S war damit 25,0 Prozent länger beschäftigt. Zusammen mit der überwiegend
|
||||
niedrigeren Inferenzgeschwindigkeit ist kein profilweiter Vorteil belegt.
|
||||
|
||||
Entscheidung: Die produktiven Q4-Profile werden nicht durch IQ3_S ersetzt und
|
||||
es werden keine vollständigen Q3-Doppelprofile angelegt. `beta1` bleibt als
|
||||
gezielter 112K-Versuch erhalten: Dort passt das gesamte Textmodell auf die RTX
|
||||
5080, während der Projektor auf der RTX 3060 liegt. Dieser besondere
|
||||
Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
|
||||
|
||||
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
|
||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
|
||||
|
||||
Reference in New Issue
Block a user