Optimize Qwen fast profile for vision and 76K context
This commit is contained in:
@@ -0,0 +1,46 @@
|
||||
# Qwen3.8-27B Fast-Profil-Test vom 20. August 2026
|
||||
|
||||
Hardware: RTX 5080 mit 16 GB VRAM. Modell: `Qwen3.8-27B-IQ4-MIX.gguf`.
|
||||
|
||||
## Ergebnis
|
||||
|
||||
Gewinner ist das Profil mit 76.800 Tokens Kontext, MTP2, Haupt-KV-Cache in Q4_0,
|
||||
MTP-Draft-KV in F16 und einem nicht auf die GPU ausgelagerten BF16-Vision-Projektor.
|
||||
|
||||
| Profil | Kontext | Kurztests TG | 30K belegt | 66K belegt | Vision | Stabilität |
|
||||
| --- | ---: | --- | ---: | ---: | --- | --- |
|
||||
| bisher: Draft-Q4 | 73.728 | 85,6 / 93,6 / 98,3 t/s | nicht gemessen | nicht gemessen | nein | stabil |
|
||||
| Draft-F16 | 73.728 | 92,7 / 100,5 / 103,4 t/s | nicht gemessen | nicht gemessen | nein | stabil |
|
||||
| Gewinner | 76.800 | 94,3 / 103,3 / 114,7 t/s | 91,5 t/s | 72,0 t/s | ja, CPU-Projektor | stabil |
|
||||
| BeeLlama KVarN4/3 | 98.304 | 82,9 / 98,2 / 90,2 t/s | nicht erreicht | nicht erreicht | nein | CUDA-OOM beim großen Prefill |
|
||||
| BeeLlama KVarN4/3 | 90.112 | Kurztest nicht wiederholt | nicht erreicht | nicht erreicht | nein | CUDA-OOM beim großen Prefill |
|
||||
|
||||
Die realistischen drei Kurztests waren deutsche Analyse, Python-Code und strukturiertes JSON
|
||||
mit jeweils bis zu 1.200 Ausgabetokens. Große Kontexttests verwendeten ausschließlich
|
||||
synthetischen Fülltext.
|
||||
|
||||
## Wichtige Erkenntnisse
|
||||
|
||||
- Der F16-Draft-Cache benötigt bei diesem einlagigen MTP weniger VRAM als der quantisierte
|
||||
Q4-Draft-Cache. Bei 73.728 Tokens stieg der freie VRAM von ungefähr 64 auf 168 MiB.
|
||||
- 81.920 Tokens waren mit MTP nicht startfähig. 76.800 Tokens starteten und bestanden einen
|
||||
Prefill mit ungefähr 66.000 synthetischen Tokens.
|
||||
- Nahe dem vollen Kontext sinkt die Ausgabe trotz unverändertem Profil unter 80 t/s. Bei
|
||||
ungefähr 30.000 belegten Tokens wurden noch 91,5 t/s erreicht, bei etwa 66.000 Tokens
|
||||
72,0 t/s. Das ist der zunehmende Attention-Aufwand, kein CPU-Offload.
|
||||
- Der 931-MB-BF16-Vision-Projektor bleibt mittels `--no-mmproj-offload` im System-RAM.
|
||||
Dadurch bleibt der VRAM-Verbrauch des Sprachmodells praktisch unverändert. Das synthetische
|
||||
Testbild wurde korrekt erkannt; Bild-Prefill etwa 2,5 Sekunden, Ausgabe etwa 92–94 t/s.
|
||||
- KVarN war in kurzen Tests vielversprechend, stürzte aber bei großen Prefills reproduzierbar
|
||||
im CUDA-Flash-Attention-Kernel mit OOM ab und ist daher nicht produktionsgeeignet.
|
||||
|
||||
## Aktives Fast-Profil
|
||||
|
||||
Siehe `platform/profiles/profile-fast.conf`. Wichtige Parameter:
|
||||
|
||||
- `--ctx-size 76800`
|
||||
- `--cache-type-k q4_0 --cache-type-v q4_0`
|
||||
- `--spec-draft-type-k f16 --spec-draft-type-v f16`
|
||||
- `--spec-draft-n-max 2`
|
||||
- `--mmproj .../mmproj-BF16.gguf --no-mmproj-offload`
|
||||
- vollständiger GPU-Offload der Modellgewichte auf `CUDA0`
|
||||
Reference in New Issue
Block a user