Files
AI-Profile-Router/docs/GSQ_RCO_BETA1_20260904.md
T

66 lines
2.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Qwen Beta 1 – GSQ-RCO
`qwen-beta-1` ist ein zusätzliches, nicht standardmäßig aktives Router-Profil.
Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unverändert.
## Laufzeitkonfiguration
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
- Kontext: 112.000 Token als konservativer Startwert
- Textmodell und KV-Cache: vollständig RTX 5080
- Vision-Projektor: RTX 3060
- KV-Quantisierung: Q4_0 für K und V
- MTP: 3 Draft-Token
- Batch / Micro-Batch: 2048 / 128
## Vorherige IQ3_XXS-Kontextgrenze
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
VRAM-Grenze verwendet.
| Kontext | Ergebnis | Rest auf RTX 5080 nach Bildlauf |
|---:|---|---:|
| 192.000 | bestanden | ca. 129 MiB |
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
Diese Werte gelten ausschließlich für die frühere, kleinere
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
## Austausch am 08.09.2026
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
## Lokaler A/B-Test am 08.09.2026
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|---|---:|---:|
| deterministische Kurzaufgaben | 24/25 | 24/25 |
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
Langkontext-Benchmark.
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.