33 lines
1.1 KiB
Markdown
33 lines
1.1 KiB
Markdown
# Qwen3.8 Pure – 256K-Validierung vom 22. August 2026
|
||
|
||
## Aufbau
|
||
|
||
- Modell: `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF`
|
||
- Datei: `qwen3.8-27b-IQ4_XS-pure.gguf`
|
||
- SHA-256: `ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675`
|
||
- Kontext: 262.144 Tokens
|
||
- GPUs: RTX 5080 + RTX 3060, Layer-Split 80:20
|
||
- KV-Cache: Q4_0 für K und V
|
||
- MTP: aktiviert, maximal zwei Draft-Tokens
|
||
- Vision-Projektor: aus
|
||
|
||
Der Test verwendete ausschließlich synthetische Daten. Es wurden keine Chats,
|
||
MCP-Antworten oder Nutzerdaten gelesen.
|
||
|
||
## Ergebnis
|
||
|
||
| Messung | IQ4_XS Pure | IQ4-MIX Referenz |
|
||
|---|---:|---:|
|
||
| Laden erfolgreich | ja | ja |
|
||
| Kurzer Ausgabetest | 68,19 Tok/s | 59,15 Tok/s |
|
||
| 220.190-Token-Prefill | 368,64 Tok/s | 357,86 Tok/s |
|
||
| Ausgabe nach 220K Prompt | 26,76 Tok/s | 26,32 Tok/s |
|
||
| Dauer des 220K-Tests | 599,91 s | 617,95 s |
|
||
| Sentinel wiedergefunden | ja | ja |
|
||
| OOM/Absturz | nein | nein |
|
||
|
||
Pure war im kurzen Ausgabetest rund 15,3 Prozent schneller. Beim fast vollen
|
||
Kontext war die Ausgabegeschwindigkeit beider Varianten nahezu gleich. Da Pure
|
||
den vollständigen Langtest bestanden hat, ist es das ausgewählte Ultra-Profil.
|
||
|