Adopt tested MTP2 for Large; retain Medium MTP3 after warmup failure

This commit is contained in:
Mikei386
2026-09-20 22:59:50 +02:00
parent 9e836cf5fd
commit b352e29c89
29 changed files with 2340 additions and 3 deletions
+31
View File
@@ -0,0 +1,31 @@
# Selektive MTP2-Übernahme
20.09.2026. Fast, Ultra und Uncensored verwenden bereits MTP2 (Containerargumente
geprüft, nicht neu gebenchmarkt). Medium und Large verwenden vorher MTP3.
Medium mit unveränderter Microbatch512 und MTP2 scheitert beim CUDA-Warmup im
isolierten Container. Frühere erfolgreiche MTP2-Versuche waren Microbatch256.
Medium bleibt daher MTP3/512. Produktion automatisch wiederhergestellt,
keine erfassten Kernel-/Xid-/OOM-Kill-Fehler.
Large mit unverändert192000Kontext, Microbatch256, Split86:14:
| Messung | MTP3 | MTP2 |
|---|---:|---:|
| Deutsch tok/s |59,67|61,36|
| Code tok/s |77,18|77,84|
| Prefill4196Tokens tok/s |1964,41|2016,76|
| Decode nach4196Tokens tok/s |62,46|66,42|
| Recall |3/3|3/3|
Large wird entsprechend Nutzerauftrag auf MTP2 übernommen. Alle übrigen
Modellargumente bleiben gleich. Je ein kurzer Lauf, Decode256Tokens,
Recall512Tokens; keine volle192K-/Vision-/Parallelitätsfreigabe. Code-Text zwischen
beiden Armen identisch, Deutsch unterschiedlich. Kleine Geschwindigkeitsunterschiede
können Messrauschen/Tokenfolgen widerspiegeln. Kein breiter Qualitätsvergleich.
Die erste Large-Testausführung hatte eine Dateinamenskollision zwischen Testplan
und Profilsnapshot und führte keine Inferenz aus. Korrigierter Plan: large-cases.json.
Rohdaten: experiments/profile-mtp2-20260920 und gleichnamiger Ordner unter
/data/benchmarks auf Athena. Aktives Profil bleibt Medium; Large mit MTP2 wird
beim nächsten Profilwechsel verwendet.
+1 -1
View File
@@ -8,7 +8,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|---|---|---:|---:|---|---|---|---:|
| fast | `qwen-fast` | 76,800 | 1 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
| medium | `qwen-medium` | 160,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 85:15 | ja | 3 |
| large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
| large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 2 |
| ultra | `qwen-ultra` | 262,144 | 1 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
| uncensored | `qwen-uncensored` | 80,000 | 1 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |