Files
AI-Profile-Router/docs/GSQ_RCO_BETA1_20260904.md

149 lines
7.8 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Qwen Beta 1 – GSQ-RCO
> Historischer Testbericht. Das Beta-1-Profil wurde am 10. September 2026
> vollständig aus dem produktiven Router entfernt, weil die kleinere
> Quantisierung gegenüber den Q4-Profilen keinen belastbaren Vorteil brachte.
`qwen-beta-1` war ein zusätzliches, nicht standardmäßig aktives Router-Profil.
Der Bericht bleibt erhalten, damit diese Quantisierung nicht versehentlich
erneut getestet wird.
## Laufzeitkonfiguration
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
- Kontext: 112.000 Token als konservativer Startwert
- Textmodell und KV-Cache: vollständig RTX 5080
- Vision-Projektor: RTX 3060
- KV-Quantisierung: Q4_0 für K und V
- MTP: 3 Draft-Token
- Batch / Micro-Batch: 2048 / 128
## Vorherige IQ3_XXS-Kontextgrenze
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
VRAM-Grenze verwendet.
| Kontext | Ergebnis | Rest auf RTX 5080 nach Bildlauf |
|---:|---|---:|
| 192.000 | bestanden | ca. 129 MiB |
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
Diese Werte gelten ausschließlich für die frühere, kleinere
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
## Austausch am 08.09.2026
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
## Lokaler A/B-Test am 08.09.2026
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|---|---:|---:|
| deterministische Kurzaufgaben | 24/25 | 24/25 |
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
Langkontext-Benchmark.
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.
## Profilweiter A/B-Härtetest am 08.09.2026
Ein zweiter Test verglich GSQ-RCO IQ3_S mit den jeweils heute verwendeten
Q4-Modellen unter den echten Kontext-, GPU-, MTP- und Batch-Einstellungen der
Profile. Medium und Large luden dabei auch den Vision-Projektor auf der RTX
3060; der dort bereits laufende TTS-Dienst blieb unangetastet. Alle acht
Varianten fanden drei synthetische Nadeln bei 70 Prozent des jeweiligen
Kontextfensters.
| Profil | Q4 kurzer Prefill | IQ3_S kurzer Prefill | Delta | Q4 Decode | IQ3_S Decode | Delta | Q4 Lang-Prefill | IQ3_S Lang-Prefill | Delta | Q4 Lang-Decode | IQ3_S Lang-Decode | Delta |
|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|
| Fast 76,8K | 938,2 | 860,5 | -8,3 % | 115,3 | 109,2 | -5,2 % | 816,7 | 757,4 | -7,3 % | 74,7 | 76,4 | +2,3 % |
| Medium 160K | 1.449,7 | 1.342,3 | -7,4 % | 104,0 | 86,9 | -16,5 % | 948,3 | 897,3 | -5,4 % | 56,3 | 48,9 | -13,1 % |
| Large 192K | 1.456,5 | 1.342,6 | -7,8 % | 104,3 | 86,9 | -16,7 % | 849,5 | 808,9 | -4,8 % | 52,2 | 45,5 | -12,8 % |
| Ultra 262K | 1.728,3 | 1.288,2 | -25,5 % | 83,8 | 73,5 | -12,3 % | 808,2 | 677,8 | -16,1 % | 33,3 | 32,0 | -4,0 % |
Alle Geschwindigkeiten sind Token/s. `Fast` vergleicht das produktive
IQ4-MIX mit IQ3_S; die übrigen Profile vergleichen IQ4_XS Pure mit IQ3_S.
Die langen Prompts enthielten rund 53,8K, 112K, 134,5K beziehungsweise 183,6K
synthetische Token.
Der komplexere Qualitätstest bestand aus neun deutschsprachigen Aufgaben zu
Logik, evidenzgebundener Diagnose, nebenläufigem Python, Kapazitätsplanung,
Prompt-Injection, Laufzeit- gegenüber Konfigurationszustand und sicherem
Adminverhalten sowie einem nativen Tool-Call. Acht Aufgaben waren inhaltlich
gleichwertig; beide Modelle hatten beim nebenläufigen Python-Code denselben
subtilen Restfehler. Bei der Kapazitätsplanung ermittelten beide intern korrekt,
dass die Migration unmöglich ist. Beide erreichten jedoch das 4K-Ausgabelimit:
Q4 gab die Schlussfolgerung und fast den ganzen Beweis sichtbar aus, IQ3_S
verbrauchte das Limit vollständig im Reasoning und lieferte keinen sichtbaren
Antworttext. Beide nativen Tool-Calls waren korrekt.
Über alle neun Aufgaben benötigte Q4 223,0 Sekunden und IQ3_S 278,9 Sekunden;
IQ3_S war damit 25,0 Prozent länger beschäftigt. Zusammen mit der überwiegend
niedrigeren Inferenzgeschwindigkeit ist kein profilweiter Vorteil belegt.
Entscheidung: Die produktiven Q4-Profile werden nicht durch IQ3_S ersetzt und
es werden keine vollständigen Q3-Doppelprofile angelegt. `beta1` bleibt als
gezielter 112K-Versuch erhalten: Dort passt das gesamte Textmodell auf die RTX
5080, während der Projektor auf der RTX 3060 liegt. Dieser besondere
Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026
Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits.
Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren
reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter
echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060
geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und
ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.
| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 |
|---|---:|---:|---:|---:|---:|
| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % |
| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % |
| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % |
Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim
ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit
96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden
VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden,
stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten
Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch
die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche
KV-, MTP- und Compute-Puffer.
Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere
Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp
schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem
kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher
Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt
sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen.
Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und
tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.