Files
AI-Profile-Router/docs/GSQ_RCO_BETA1_20260904.md
T

5.6 KiB
Raw Blame History

Qwen Beta 1 – GSQ-RCO

qwen-beta-1 ist ein zusätzliches, nicht standardmäßig aktives Router-Profil. Die bestehenden Profile und das Standardprofil qwen-medium bleiben unverändert.

Laufzeitkonfiguration

  • Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
  • Kontext: 112.000 Token als konservativer Startwert
  • Textmodell und KV-Cache: vollständig RTX 5080
  • Vision-Projektor: RTX 3060
  • KV-Quantisierung: Q4_0 für K und V
  • MTP: 3 Draft-Token
  • Batch / Micro-Batch: 2048 / 128

Vorherige IQ3_XXS-Kontextgrenze

Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der VRAM-Grenze verwendet.

Kontext Ergebnis Rest auf RTX 5080 nach Bildlauf
192.000 bestanden ca. 129 MiB
196.608 bestanden, harte Kante ca. 9 MiB
197.120 CUDA Out of Memory ca. 1 MiB vor Abbruch

Diese Werte gelten ausschließlich für die frühere, kleinere IQ3_XXS-MTP-Datei. Sie dürfen nicht als Grenze der größeren IQ3_S-MTP-Datei interpretiert werden. Das neue Profil startet bei 112.000 Token; seine technische und betrieblich sichere Grenze wird neu vermessen.

Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt- Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.

Austausch am 08.09.2026

Die bisherige IQ3_XXS-MTP-Datei wurde durch IQ3_S-MTP ersetzt. ISTA berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.

Lokaler A/B-Test am 08.09.2026

Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.

Messung IQ4_XS Pure GSQ-RCO IQ3_S MTP
deterministische Kurzaufgaben 24/25 24/25
Decode, 512 Token 65,6 Token/s 59,3 Token/s
Prefill, 30 Token 184,5 Token/s 251,6 Token/s

Beide Modelle machten denselben einzelnen Fehler bei 2^100 modulo 13. Im lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein Langkontext-Benchmark.

In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9 Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080 frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter /data/model-benchmarks/gsq-rco-iq3s-ab-20260908/.

Profilweiter A/B-Härtetest am 08.09.2026

Ein zweiter Test verglich GSQ-RCO IQ3_S mit den jeweils heute verwendeten Q4-Modellen unter den echten Kontext-, GPU-, MTP- und Batch-Einstellungen der Profile. Medium und Large luden dabei auch den Vision-Projektor auf der RTX 3060; der dort bereits laufende TTS-Dienst blieb unangetastet. Alle acht Varianten fanden drei synthetische Nadeln bei 70 Prozent des jeweiligen Kontextfensters.

Profil Q4 kurzer Prefill IQ3_S kurzer Prefill Delta Q4 Decode IQ3_S Decode Delta Q4 Lang-Prefill IQ3_S Lang-Prefill Delta Q4 Lang-Decode IQ3_S Lang-Decode Delta
Fast 76,8K 938,2 860,5 -8,3 % 115,3 109,2 -5,2 % 816,7 757,4 -7,3 % 74,7 76,4 +2,3 %
Medium 160K 1.449,7 1.342,3 -7,4 % 104,0 86,9 -16,5 % 948,3 897,3 -5,4 % 56,3 48,9 -13,1 %
Large 192K 1.456,5 1.342,6 -7,8 % 104,3 86,9 -16,7 % 849,5 808,9 -4,8 % 52,2 45,5 -12,8 %
Ultra 262K 1.728,3 1.288,2 -25,5 % 83,8 73,5 -12,3 % 808,2 677,8 -16,1 % 33,3 32,0 -4,0 %

Alle Geschwindigkeiten sind Token/s. Fast vergleicht das produktive IQ4-MIX mit IQ3_S; die übrigen Profile vergleichen IQ4_XS Pure mit IQ3_S. Die langen Prompts enthielten rund 53,8K, 112K, 134,5K beziehungsweise 183,6K synthetische Token.

Der komplexere Qualitätstest bestand aus neun deutschsprachigen Aufgaben zu Logik, evidenzgebundener Diagnose, nebenläufigem Python, Kapazitätsplanung, Prompt-Injection, Laufzeit- gegenüber Konfigurationszustand und sicherem Adminverhalten sowie einem nativen Tool-Call. Acht Aufgaben waren inhaltlich gleichwertig; beide Modelle hatten beim nebenläufigen Python-Code denselben subtilen Restfehler. Bei der Kapazitätsplanung ermittelten beide intern korrekt, dass die Migration unmöglich ist. Beide erreichten jedoch das 4K-Ausgabelimit: Q4 gab die Schlussfolgerung und fast den ganzen Beweis sichtbar aus, IQ3_S verbrauchte das Limit vollständig im Reasoning und lieferte keinen sichtbaren Antworttext. Beide nativen Tool-Calls waren korrekt.

Über alle neun Aufgaben benötigte Q4 223,0 Sekunden und IQ3_S 278,9 Sekunden; IQ3_S war damit 25,0 Prozent länger beschäftigt. Zusammen mit der überwiegend niedrigeren Inferenzgeschwindigkeit ist kein profilweiter Vorteil belegt.

Entscheidung: Die produktiven Q4-Profile werden nicht durch IQ3_S ersetzt und es werden keine vollständigen Q3-Doppelprofile angelegt. beta1 bleibt als gezielter 112K-Versuch erhalten: Dort passt das gesamte Textmodell auf die RTX 5080, während der Projektor auf der RTX 3060 liegt. Dieser besondere Platzierungsvorteil gilt nicht automatisch für die größeren Profile.

Die vollständigen JSON-Ergebnisse liegen auf Athena unter /data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/.