32 lines
1.5 KiB
Markdown
32 lines
1.5 KiB
Markdown
# Selektive MTP2-Übernahme
|
|
|
|
20.09.2026. Fast, Ultra und Uncensored verwenden bereits MTP2 (Containerargumente
|
|
geprüft, nicht neu gebenchmarkt). Medium und Large verwenden vorher MTP3.
|
|
|
|
Medium mit unveränderter Microbatch512 und MTP2 scheitert beim CUDA-Warmup im
|
|
isolierten Container. Frühere erfolgreiche MTP2-Versuche waren Microbatch256.
|
|
Medium bleibt daher MTP3/512. Produktion automatisch wiederhergestellt,
|
|
keine erfassten Kernel-/Xid-/OOM-Kill-Fehler.
|
|
|
|
Large mit unverändert192000Kontext, Microbatch256, Split86:14:
|
|
|
|
| Messung | MTP3 | MTP2 |
|
|
|---|---:|---:|
|
|
| Deutsch tok/s |59,67|61,36|
|
|
| Code tok/s |77,18|77,84|
|
|
| Prefill4196Tokens tok/s |1964,41|2016,76|
|
|
| Decode nach4196Tokens tok/s |62,46|66,42|
|
|
| Recall |3/3|3/3|
|
|
|
|
Large wird entsprechend Nutzerauftrag auf MTP2 übernommen. Alle übrigen
|
|
Modellargumente bleiben gleich. Je ein kurzer Lauf, Decode256Tokens,
|
|
Recall512Tokens; keine volle192K-/Vision-/Parallelitätsfreigabe. Code-Text zwischen
|
|
beiden Armen identisch, Deutsch unterschiedlich. Kleine Geschwindigkeitsunterschiede
|
|
können Messrauschen/Tokenfolgen widerspiegeln. Kein breiter Qualitätsvergleich.
|
|
|
|
Die erste Large-Testausführung hatte eine Dateinamenskollision zwischen Testplan
|
|
und Profilsnapshot und führte keine Inferenz aus. Korrigierter Plan: large-cases.json.
|
|
Rohdaten: experiments/profile-mtp2-20260920 und gleichnamiger Ordner unter
|
|
/data/benchmarks auf Athena. Aktives Profil bleibt Medium; Large mit MTP2 wird
|
|
beim nächsten Profilwechsel verwendet.
|