144 lines
7.5 KiB
Markdown
144 lines
7.5 KiB
Markdown
# Qwen Beta 1 – GSQ-RCO
|
||
|
||
`qwen-beta-1` ist ein zusätzliches, nicht standardmäßig aktives Router-Profil.
|
||
Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unverändert.
|
||
|
||
## Laufzeitkonfiguration
|
||
|
||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
|
||
- Kontext: 112.000 Token als konservativer Startwert
|
||
- Textmodell und KV-Cache: vollständig RTX 5080
|
||
- Vision-Projektor: RTX 3060
|
||
- KV-Quantisierung: Q4_0 für K und V
|
||
- MTP: 3 Draft-Token
|
||
- Batch / Micro-Batch: 2048 / 128
|
||
|
||
## Vorherige IQ3_XXS-Kontextgrenze
|
||
|
||
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
||
VRAM-Grenze verwendet.
|
||
|
||
| Kontext | Ergebnis | Rest auf RTX 5080 nach Bildlauf |
|
||
|---:|---|---:|
|
||
| 192.000 | bestanden | ca. 129 MiB |
|
||
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
||
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
||
|
||
Diese Werte gelten ausschließlich für die frühere, kleinere
|
||
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
|
||
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
|
||
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
|
||
|
||
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
||
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|
||
|
||
## Austausch am 08.09.2026
|
||
|
||
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
|
||
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
|
||
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
|
||
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
|
||
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
|
||
|
||
## Lokaler A/B-Test am 08.09.2026
|
||
|
||
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
|
||
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
|
||
|
||
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|
||
|---|---:|---:|
|
||
| deterministische Kurzaufgaben | 24/25 | 24/25 |
|
||
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
|
||
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
|
||
|
||
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
|
||
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
|
||
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
|
||
Langkontext-Benchmark.
|
||
|
||
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
|
||
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
|
||
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
|
||
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
|
||
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
|
||
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
|
||
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.
|
||
|
||
## Profilweiter A/B-Härtetest am 08.09.2026
|
||
|
||
Ein zweiter Test verglich GSQ-RCO IQ3_S mit den jeweils heute verwendeten
|
||
Q4-Modellen unter den echten Kontext-, GPU-, MTP- und Batch-Einstellungen der
|
||
Profile. Medium und Large luden dabei auch den Vision-Projektor auf der RTX
|
||
3060; der dort bereits laufende TTS-Dienst blieb unangetastet. Alle acht
|
||
Varianten fanden drei synthetische Nadeln bei 70 Prozent des jeweiligen
|
||
Kontextfensters.
|
||
|
||
| Profil | Q4 kurzer Prefill | IQ3_S kurzer Prefill | Delta | Q4 Decode | IQ3_S Decode | Delta | Q4 Lang-Prefill | IQ3_S Lang-Prefill | Delta | Q4 Lang-Decode | IQ3_S Lang-Decode | Delta |
|
||
|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|
|
||
| Fast 76,8K | 938,2 | 860,5 | -8,3 % | 115,3 | 109,2 | -5,2 % | 816,7 | 757,4 | -7,3 % | 74,7 | 76,4 | +2,3 % |
|
||
| Medium 160K | 1.449,7 | 1.342,3 | -7,4 % | 104,0 | 86,9 | -16,5 % | 948,3 | 897,3 | -5,4 % | 56,3 | 48,9 | -13,1 % |
|
||
| Large 192K | 1.456,5 | 1.342,6 | -7,8 % | 104,3 | 86,9 | -16,7 % | 849,5 | 808,9 | -4,8 % | 52,2 | 45,5 | -12,8 % |
|
||
| Ultra 262K | 1.728,3 | 1.288,2 | -25,5 % | 83,8 | 73,5 | -12,3 % | 808,2 | 677,8 | -16,1 % | 33,3 | 32,0 | -4,0 % |
|
||
|
||
Alle Geschwindigkeiten sind Token/s. `Fast` vergleicht das produktive
|
||
IQ4-MIX mit IQ3_S; die übrigen Profile vergleichen IQ4_XS Pure mit IQ3_S.
|
||
Die langen Prompts enthielten rund 53,8K, 112K, 134,5K beziehungsweise 183,6K
|
||
synthetische Token.
|
||
|
||
Der komplexere Qualitätstest bestand aus neun deutschsprachigen Aufgaben zu
|
||
Logik, evidenzgebundener Diagnose, nebenläufigem Python, Kapazitätsplanung,
|
||
Prompt-Injection, Laufzeit- gegenüber Konfigurationszustand und sicherem
|
||
Adminverhalten sowie einem nativen Tool-Call. Acht Aufgaben waren inhaltlich
|
||
gleichwertig; beide Modelle hatten beim nebenläufigen Python-Code denselben
|
||
subtilen Restfehler. Bei der Kapazitätsplanung ermittelten beide intern korrekt,
|
||
dass die Migration unmöglich ist. Beide erreichten jedoch das 4K-Ausgabelimit:
|
||
Q4 gab die Schlussfolgerung und fast den ganzen Beweis sichtbar aus, IQ3_S
|
||
verbrauchte das Limit vollständig im Reasoning und lieferte keinen sichtbaren
|
||
Antworttext. Beide nativen Tool-Calls waren korrekt.
|
||
|
||
Über alle neun Aufgaben benötigte Q4 223,0 Sekunden und IQ3_S 278,9 Sekunden;
|
||
IQ3_S war damit 25,0 Prozent länger beschäftigt. Zusammen mit der überwiegend
|
||
niedrigeren Inferenzgeschwindigkeit ist kein profilweiter Vorteil belegt.
|
||
|
||
Entscheidung: Die produktiven Q4-Profile werden nicht durch IQ3_S ersetzt und
|
||
es werden keine vollständigen Q3-Doppelprofile angelegt. `beta1` bleibt als
|
||
gezielter 112K-Versuch erhalten: Dort passt das gesamte Textmodell auf die RTX
|
||
5080, während der Projektor auf der RTX 3060 liegt. Dieser besondere
|
||
Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
|
||
|
||
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
|
||
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
|
||
|
||
## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026
|
||
|
||
Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits.
|
||
Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren
|
||
reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter
|
||
echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060
|
||
geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und
|
||
ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.
|
||
|
||
| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 |
|
||
|---|---:|---:|---:|---:|---:|
|
||
| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % |
|
||
| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % |
|
||
| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % |
|
||
|
||
Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim
|
||
ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit
|
||
96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden
|
||
VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden,
|
||
stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten
|
||
Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch
|
||
die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche
|
||
KV-, MTP- und Compute-Puffer.
|
||
|
||
Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere
|
||
Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp
|
||
schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem
|
||
kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher
|
||
Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt
|
||
sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen.
|
||
Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und
|
||
tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.
|