1.6 KiB
Selektive MTP2-Übernahme
Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large auf MTP2 übernommen: aktueller Abschluss.
20.09.2026. Fast, Ultra und Uncensored verwenden bereits MTP2 (Containerargumente geprüft, nicht neu gebenchmarkt). Medium und Large verwenden vorher MTP3.
Medium mit unveränderter Microbatch512 und MTP2 scheitert beim CUDA-Warmup im isolierten Container. Frühere erfolgreiche MTP2-Versuche waren Microbatch256. Medium bleibt daher MTP3/512. Produktion automatisch wiederhergestellt, keine erfassten Kernel-/Xid-/OOM-Kill-Fehler.
Large mit unverändert192000Kontext, Microbatch256, Split86:14:
| Messung | MTP3 | MTP2 |
|---|---|---|
| Deutsch tok/s | 59,67 | 61,36 |
| Code tok/s | 77,18 | 77,84 |
| Prefill4196Tokens tok/s | 1964,41 | 2016,76 |
| Decode nach4196Tokens tok/s | 62,46 | 66,42 |
| Recall | 3/3 | 3/3 |
Large wird entsprechend Nutzerauftrag auf MTP2 übernommen. Alle übrigen Modellargumente bleiben gleich. Je ein kurzer Lauf, Decode256Tokens, Recall512Tokens; keine volle192K-/Vision-/Parallelitätsfreigabe. Code-Text zwischen beiden Armen identisch, Deutsch unterschiedlich. Kleine Geschwindigkeitsunterschiede können Messrauschen/Tokenfolgen widerspiegeln. Kein breiter Qualitätsvergleich.
Die erste Large-Testausführung hatte eine Dateinamenskollision zwischen Testplan und Profilsnapshot und führte keine Inferenz aus. Korrigierter Plan: large-cases.json. Rohdaten: experiments/profile-mtp2-20260920 und gleichnamiger Ordner unter /data/benchmarks auf Athena. Aktives Profil bleibt Medium; Large mit MTP2 wird beim nächsten Profilwechsel verwendet.