Files
AI-Profile-Router/docs/qwen38-pure-256k-benchmark-2026-08-22.md
T

33 lines
1.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Qwen3.8 Pure – 256K-Validierung vom 22. August 2026
## Aufbau
- Modell: `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF`
- Datei: `qwen3.8-27b-IQ4_XS-pure.gguf`
- SHA-256: `ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675`
- Kontext: 262.144 Tokens
- GPUs: RTX 5080 + RTX 3060, Layer-Split 80:20
- KV-Cache: Q4_0 für K und V
- MTP: aktiviert, maximal zwei Draft-Tokens
- Vision-Projektor: aus
Der Test verwendete ausschließlich synthetische Daten. Es wurden keine Chats,
MCP-Antworten oder Nutzerdaten gelesen.
## Ergebnis
| Messung | IQ4_XS Pure | IQ4-MIX Referenz |
|---|---:|---:|
| Laden erfolgreich | ja | ja |
| Kurzer Ausgabetest | 68,19 Tok/s | 59,15 Tok/s |
| 220.190-Token-Prefill | 368,64 Tok/s | 357,86 Tok/s |
| Ausgabe nach 220K Prompt | 26,76 Tok/s | 26,32 Tok/s |
| Dauer des 220K-Tests | 599,91 s | 617,95 s |
| Sentinel wiedergefunden | ja | ja |
| OOM/Absturz | nein | nein |
Pure war im kurzen Ausgabetest rund 15,3 Prozent schneller. Beim fast vollen
Kontext war die Ausgabegeschwindigkeit beider Varianten nahezu gleich. Da Pure
den vollständigen Langtest bestanden hat, ist es das ausgewählte Ultra-Profil.