Validate Pure quant for 256K Ultra profile
This commit is contained in:
@@ -58,6 +58,7 @@ Zielplattform.
|
||||
| Fast | `qwen-fast` | 76.800 | IQ4-MIX, MTP2, vollständig GPU, CPU-mmproj |
|
||||
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP, CPU-mmproj |
|
||||
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN 0–11 auf CPU, CPU-mmproj |
|
||||
| Ultra | `qwen-ultra` | 262.144 | IQ4_XS Pure, MTP2, beide GPUs 80:20, text-only; 68,2 Tok/s und 220K-Fülltest bestanden |
|
||||
|
||||
## Router
|
||||
|
||||
|
||||
+2
-2
@@ -74,11 +74,11 @@ Community Store nachgeladen.
|
||||
| Fast | `qwen-fast` | 76.800 | Alltag, Agenten, hohe Geschwindigkeit, integrierte Vision |
|
||||
| Medium | `qwen-medium` | 94.208 | mehr Kontext, reine IQ4_XS-Variante |
|
||||
| Long | `qwen-long` | 131.072 | lange Hermes-/MCP-Sitzungen |
|
||||
| Ultra | `qwen-ultra` | 262.144 | maximaler Textkontext, IQ4-MIX auf RTX 5080 + RTX 3060 (80:20), ohne Vision-Projektor |
|
||||
| Ultra | `qwen-ultra` | 262.144 | maximaler Textkontext, IQ4_XS Pure auf RTX 5080 + RTX 3060 (80:20), ohne Vision-Projektor |
|
||||
|
||||
Manuell wird mit `llama-profile fast|medium|long|ultra` gewechselt. Über HTTP stehen
|
||||
`POST /fast`, `/medium`, `/long` und `/ultra` zur Verfügung. Ultra erreichte im
|
||||
Referenzlauf etwa 59 Token/s; ein Prompt-Fülltest mit rund 220.000 Tokens war
|
||||
Referenzlauf etwa 68 Token/s; ein Prompt-Fülltest mit rund 220.000 Tokens war
|
||||
erfolgreich. Für eine spätere Version ist
|
||||
`large` als Alias für `long` vorgesehen; bestehende Namen bleiben kompatibel.
|
||||
|
||||
|
||||
@@ -0,0 +1,32 @@
|
||||
# Qwen3.8 Pure – 256K-Validierung vom 22. August 2026
|
||||
|
||||
## Aufbau
|
||||
|
||||
- Modell: `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF`
|
||||
- Datei: `qwen3.8-27b-IQ4_XS-pure.gguf`
|
||||
- SHA-256: `ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675`
|
||||
- Kontext: 262.144 Tokens
|
||||
- GPUs: RTX 5080 + RTX 3060, Layer-Split 80:20
|
||||
- KV-Cache: Q4_0 für K und V
|
||||
- MTP: aktiviert, maximal zwei Draft-Tokens
|
||||
- Vision-Projektor: aus
|
||||
|
||||
Der Test verwendete ausschließlich synthetische Daten. Es wurden keine Chats,
|
||||
MCP-Antworten oder Nutzerdaten gelesen.
|
||||
|
||||
## Ergebnis
|
||||
|
||||
| Messung | IQ4_XS Pure | IQ4-MIX Referenz |
|
||||
|---|---:|---:|
|
||||
| Laden erfolgreich | ja | ja |
|
||||
| Kurzer Ausgabetest | 68,19 Tok/s | 59,15 Tok/s |
|
||||
| 220.190-Token-Prefill | 368,64 Tok/s | 357,86 Tok/s |
|
||||
| Ausgabe nach 220K Prompt | 26,76 Tok/s | 26,32 Tok/s |
|
||||
| Dauer des 220K-Tests | 599,91 s | 617,95 s |
|
||||
| Sentinel wiedergefunden | ja | ja |
|
||||
| OOM/Absturz | nein | nein |
|
||||
|
||||
Pure war im kurzen Ausgabetest rund 15,3 Prozent schneller. Beim fast vollen
|
||||
Kontext war die Ausgabegeschwindigkeit beider Varianten nahezu gleich. Da Pure
|
||||
den vollständigen Langtest bestanden hat, ist es das ausgewählte Ultra-Profil.
|
||||
|
||||
Reference in New Issue
Block a user