33 lines
1.1 KiB
Markdown
33 lines
1.1 KiB
Markdown
# Qwen Beta 1 – GSQ-RCO
|
||
|
||
`qwen-beta-1` ist ein zusätzliches, nicht standardmäßig aktives Router-Profil.
|
||
Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unverändert.
|
||
|
||
## Laufzeitkonfiguration
|
||
|
||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_XXS MTP
|
||
- Kontext: 192.000 Token
|
||
- Textmodell und KV-Cache: vollständig RTX 5080
|
||
- Vision-Projektor: RTX 3060
|
||
- KV-Quantisierung: Q4_0 für K und V
|
||
- MTP: 3 Draft-Token
|
||
- Batch / Micro-Batch: 2048 / 128
|
||
|
||
## Gemessene Kontextgrenze
|
||
|
||
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
||
VRAM-Grenze verwendet.
|
||
|
||
| Kontext | Ergebnis | Rest auf RTX 5080 nach Bildlauf |
|
||
|---:|---|---:|
|
||
| 192.000 | bestanden | ca. 129 MiB |
|
||
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
||
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
||
|
||
Der produktive Beta-Modus verwendet deshalb 192.000 Token. 196.608 ist nur
|
||
die gemessene technische Obergrenze und besitzt keine ausreichende Reserve
|
||
für einen verlässlichen Dauerbetrieb.
|
||
|
||
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
||
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|