Record bounded Medium GPU split and MTP comparison
This commit is contained in:
@@ -0,0 +1,55 @@
|
||||
# Medium: GPU-Split und MTP – Kurzvergleich 20.09.2026
|
||||
|
||||
Vier isolierte Läufe mit Pure IQ4_XS, 160.000 konfigurierten Kontexttokens,
|
||||
zwei Slots, Vision geladen, TTS auf der 3060, Microbatch 256. Produktionsprofil
|
||||
nachher unverändert wiederhergestellt (85:15, MTP3, Microbatch512).
|
||||
|
||||
| Split 5080:3060 / MTP | Deutsch tok/s | Code tok/s | 24K Prefill tok/s | Decode nach 24K tok/s | Peak 5080 MiB | Peak 3060 MiB |
|
||||
|---|---:|---:|---:|---:|---:|---:|
|
||||
| 85:15 / 3 Kontrolle | 57,39 | 75,37 | 1907,30 | 59,96 | 15860 | 10646 |
|
||||
| 85:15 / 2 | 63,32 | 75,35 | 1906,40 | 59,85 | 15592 | 10614 |
|
||||
| 85:15 / 4 | 51,36 | 78,87 | 1813,80 | 50,33 | 15872 | 10420 |
|
||||
| 83:17 / 3 | 57,54 | 73,99 | 1930,21 | 56,12 | 15274 | 11230 |
|
||||
|
||||
## Einordnung
|
||||
|
||||
MTP2 ist der interessanteste Folgekandidat: +10,3 % beim deutschen Text,
|
||||
praktisch gleiche Code-/24K-Raten und 268 MiB weniger gesampelte Spitzenbelegung
|
||||
auf der 5080. MTP4 ist beim Code +4,6 %, aber bei Deutsch −10,5 % und beim Decode
|
||||
nach 24K −16,1 %. 83:17 verschafft mehr Reserve auf der 5080, liefert aber keinen
|
||||
klaren Gesamtgewinn und belegt die langsamere 3060 stärker.
|
||||
|
||||
Dies sind je ein Lauf und unterschiedliche erzeugte Tokenfolgen. Identische
|
||||
Prompts, Samplingwerte und Seeds erzwingen über veränderte MTP-/GPU-Konfigurationen
|
||||
keine identischen Antworten. Die Werte sind keine isolierten Messungen derselben
|
||||
Tokenfolge und kein Nachweis eines allgemeinen 10-%-Gewinns.
|
||||
|
||||
Alle vier Läufe finden die drei eingebetteten Fakten korrekt (3/3). Modellgewichte
|
||||
und Quantisierung unverändert. Keine allgemeine Qualitätsgleichheit nachgewiesen:
|
||||
Die beiden Decode-Aufgaben wurden absichtlich bei 768 Ausgabetokens begrenzt
|
||||
(`finish_reason=length`); kein vollständiger Code-Test oder breiter Qualitätstest.
|
||||
Die Recall-Ausgaben enthalten korrekte Werte, aber auch überflüssige Erläuterungen.
|
||||
Keine Vision-, Parallelitäts- oder volle160K-Prüfung; größte tatsächliche Eingabe
|
||||
24.674 Tokens, gefolgt von512 Ausgabetokens. Kein höheres Kontextmaximum ermittelt.
|
||||
|
||||
## Sicherheit und Reproduzierbarkeit
|
||||
|
||||
Runner kopiert die echten Produktionsargumente. Variiert werden nur Microbatch,
|
||||
Split, MTP-Tiefe sowie isolierter Port/Host und Log-Verbosity. Der neue Kontrolllauf
|
||||
ist für diesen direkten Vergleich erforderlich, keine Wiederholung der breiten
|
||||
archivierten Qwen-Modellreferenz. Kein Prompt-Cache in den Messanfragen.
|
||||
|
||||
Nach laufenden Anfragen erfolgte ein begrenzter Testbetrieb mit automatischer
|
||||
Wiederherstellung. 448MiB Mindestreserve nach Laden, 85°C Temperatur- und3GiB
|
||||
Host-RAM-Grenze. Container26GiB RAM ohne zusätzliches Swapbudget; keine Host-,
|
||||
Treiber-, Netzwerk- oder Kerneländerungen. Maximal75°C5080/58°C3060 gemessen.
|
||||
PCIe unter Last: 5080Gen4x16, 3060Gen3x4. Keine Kernel-/Xid-/OOM-Kill-Meldungen.
|
||||
Router/Medium/Controller/Gateway/TTS danach gesund, readiness und OK-Antwort bestanden.
|
||||
|
||||
Rohdaten einschließlich Antworten, tatsächlichen Argumenten, GPU-Samples und
|
||||
komprimierten Serverlogs: `experiments/medium-split-mtp-20260920/`.
|
||||
Athena: `/data/benchmarks/medium-split-mtp-20260920/`.
|
||||
|
||||
Empfehlung: vor dauerhafter Umstellung MTP2/Microbatch256 mit vollständigen
|
||||
Qualitätsantworten und relevanter Langkontext-/Visionlast prüfen. Kein automatischer
|
||||
Folgetest und keine Produktionsumstellung durch diesen Kurzvergleich.
|
||||
Reference in New Issue
Block a user