66 lines
2.7 KiB
Markdown
66 lines
2.7 KiB
Markdown
# Qwen Beta 1 – GSQ-RCO
|
||
|
||
`qwen-beta-1` ist ein zusätzliches, nicht standardmäßig aktives Router-Profil.
|
||
Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unverändert.
|
||
|
||
## Laufzeitkonfiguration
|
||
|
||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
|
||
- Kontext: 112.000 Token als konservativer Startwert
|
||
- Textmodell und KV-Cache: vollständig RTX 5080
|
||
- Vision-Projektor: RTX 3060
|
||
- KV-Quantisierung: Q4_0 für K und V
|
||
- MTP: 3 Draft-Token
|
||
- Batch / Micro-Batch: 2048 / 128
|
||
|
||
## Vorherige IQ3_XXS-Kontextgrenze
|
||
|
||
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
||
VRAM-Grenze verwendet.
|
||
|
||
| Kontext | Ergebnis | Rest auf RTX 5080 nach Bildlauf |
|
||
|---:|---|---:|
|
||
| 192.000 | bestanden | ca. 129 MiB |
|
||
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
||
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
||
|
||
Diese Werte gelten ausschließlich für die frühere, kleinere
|
||
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
|
||
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
|
||
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
|
||
|
||
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
||
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|
||
|
||
## Austausch am 08.09.2026
|
||
|
||
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
|
||
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
|
||
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
|
||
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
|
||
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
|
||
|
||
## Lokaler A/B-Test am 08.09.2026
|
||
|
||
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
|
||
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
|
||
|
||
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|
||
|---|---:|---:|
|
||
| deterministische Kurzaufgaben | 24/25 | 24/25 |
|
||
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
|
||
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
|
||
|
||
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
|
||
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
|
||
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
|
||
Langkontext-Benchmark.
|
||
|
||
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
|
||
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
|
||
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
|
||
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
|
||
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
|
||
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
|
||
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.
|