Files
AI-Profile-Router/docs/GSQ_RCO_BETA1_20260904.md
T

7.8 KiB
Raw Blame History

Qwen Beta 1 – GSQ-RCO

Historischer Testbericht. Das Beta-1-Profil wurde am 10. September 2026 vollständig aus dem produktiven Router entfernt, weil die kleinere Quantisierung gegenüber den Q4-Profilen keinen belastbaren Vorteil brachte.

qwen-beta-1 war ein zusätzliches, nicht standardmäßig aktives Router-Profil. Der Bericht bleibt erhalten, damit diese Quantisierung nicht versehentlich erneut getestet wird.

Laufzeitkonfiguration

  • Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
  • Kontext: 112.000 Token als konservativer Startwert
  • Textmodell und KV-Cache: vollständig RTX 5080
  • Vision-Projektor: RTX 3060
  • KV-Quantisierung: Q4_0 für K und V
  • MTP: 3 Draft-Token
  • Batch / Micro-Batch: 2048 / 128

Vorherige IQ3_XXS-Kontextgrenze

Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der VRAM-Grenze verwendet.

Kontext Ergebnis Rest auf RTX 5080 nach Bildlauf
192.000 bestanden ca. 129 MiB
196.608 bestanden, harte Kante ca. 9 MiB
197.120 CUDA Out of Memory ca. 1 MiB vor Abbruch

Diese Werte gelten ausschließlich für die frühere, kleinere IQ3_XXS-MTP-Datei. Sie dürfen nicht als Grenze der größeren IQ3_S-MTP-Datei interpretiert werden. Das neue Profil startet bei 112.000 Token; seine technische und betrieblich sichere Grenze wird neu vermessen.

Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt- Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.

Austausch am 08.09.2026

Die bisherige IQ3_XXS-MTP-Datei wurde durch IQ3_S-MTP ersetzt. ISTA berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.

Lokaler A/B-Test am 08.09.2026

Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.

Messung IQ4_XS Pure GSQ-RCO IQ3_S MTP
deterministische Kurzaufgaben 24/25 24/25
Decode, 512 Token 65,6 Token/s 59,3 Token/s
Prefill, 30 Token 184,5 Token/s 251,6 Token/s

Beide Modelle machten denselben einzelnen Fehler bei 2^100 modulo 13. Im lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein Langkontext-Benchmark.

In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9 Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080 frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter /data/model-benchmarks/gsq-rco-iq3s-ab-20260908/.

Profilweiter A/B-Härtetest am 08.09.2026

Ein zweiter Test verglich GSQ-RCO IQ3_S mit den jeweils heute verwendeten Q4-Modellen unter den echten Kontext-, GPU-, MTP- und Batch-Einstellungen der Profile. Medium und Large luden dabei auch den Vision-Projektor auf der RTX 3060; der dort bereits laufende TTS-Dienst blieb unangetastet. Alle acht Varianten fanden drei synthetische Nadeln bei 70 Prozent des jeweiligen Kontextfensters.

Profil Q4 kurzer Prefill IQ3_S kurzer Prefill Delta Q4 Decode IQ3_S Decode Delta Q4 Lang-Prefill IQ3_S Lang-Prefill Delta Q4 Lang-Decode IQ3_S Lang-Decode Delta
Fast 76,8K 938,2 860,5 -8,3 % 115,3 109,2 -5,2 % 816,7 757,4 -7,3 % 74,7 76,4 +2,3 %
Medium 160K 1.449,7 1.342,3 -7,4 % 104,0 86,9 -16,5 % 948,3 897,3 -5,4 % 56,3 48,9 -13,1 %
Large 192K 1.456,5 1.342,6 -7,8 % 104,3 86,9 -16,7 % 849,5 808,9 -4,8 % 52,2 45,5 -12,8 %
Ultra 262K 1.728,3 1.288,2 -25,5 % 83,8 73,5 -12,3 % 808,2 677,8 -16,1 % 33,3 32,0 -4,0 %

Alle Geschwindigkeiten sind Token/s. Fast vergleicht das produktive IQ4-MIX mit IQ3_S; die übrigen Profile vergleichen IQ4_XS Pure mit IQ3_S. Die langen Prompts enthielten rund 53,8K, 112K, 134,5K beziehungsweise 183,6K synthetische Token.

Der komplexere Qualitätstest bestand aus neun deutschsprachigen Aufgaben zu Logik, evidenzgebundener Diagnose, nebenläufigem Python, Kapazitätsplanung, Prompt-Injection, Laufzeit- gegenüber Konfigurationszustand und sicherem Adminverhalten sowie einem nativen Tool-Call. Acht Aufgaben waren inhaltlich gleichwertig; beide Modelle hatten beim nebenläufigen Python-Code denselben subtilen Restfehler. Bei der Kapazitätsplanung ermittelten beide intern korrekt, dass die Migration unmöglich ist. Beide erreichten jedoch das 4K-Ausgabelimit: Q4 gab die Schlussfolgerung und fast den ganzen Beweis sichtbar aus, IQ3_S verbrauchte das Limit vollständig im Reasoning und lieferte keinen sichtbaren Antworttext. Beide nativen Tool-Calls waren korrekt.

Über alle neun Aufgaben benötigte Q4 223,0 Sekunden und IQ3_S 278,9 Sekunden; IQ3_S war damit 25,0 Prozent länger beschäftigt. Zusammen mit der überwiegend niedrigeren Inferenzgeschwindigkeit ist kein profilweiter Vorteil belegt.

Entscheidung: Die produktiven Q4-Profile werden nicht durch IQ3_S ersetzt und es werden keine vollständigen Q3-Doppelprofile angelegt. beta1 bleibt als gezielter 112K-Versuch erhalten: Dort passt das gesamte Textmodell auf die RTX 5080, während der Projektor auf der RTX 3060 liegt. Dieser besondere Platzierungsvorteil gilt nicht automatisch für die größeren Profile.

Die vollständigen JSON-Ergebnisse liegen auf Athena unter /data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/.

Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026

Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits. Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060 geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.

Profil stabiler IQ3_S-Split 5080:3060 kurzer Prefill vs. Q4 Decode vs. Q4 Lang-Prefill vs. Q4 Lang-Decode vs. Q4
Medium 160K 96:4 +1,1 % -8,2 % +2,9 % -2,8 %
Large 192K 96:4 +0,8 % -8,3 % +1,9 % -2,1 %
Ultra 262K 88:12 -20,1 % -4,5 % -12,4 % +3,2 %

Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit 96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden, stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche KV-, MTP- und Compute-Puffer.

Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen. Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und tragen das Suffix opt96-4 beziehungsweise opt88-12.