59 lines
3.4 KiB
Markdown
59 lines
3.4 KiB
Markdown
# Medium: GPU-Split und MTP – Kurzvergleich 20.09.2026
|
||
|
||
> Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large
|
||
> auf MTP2 übernommen: [aktueller Abschluss](ATHENA_SESSION_20260920.md).
|
||
|
||
Vier isolierte Läufe mit Pure IQ4_XS, 160.000 konfigurierten Kontexttokens,
|
||
zwei Slots, Vision geladen, TTS auf der 3060, Microbatch 256. Produktionsprofil
|
||
nachher unverändert wiederhergestellt (85:15, MTP3, Microbatch512).
|
||
|
||
| Split 5080:3060 / MTP | Deutsch tok/s | Code tok/s | 24K Prefill tok/s | Decode nach 24K tok/s | Peak 5080 MiB | Peak 3060 MiB |
|
||
|---|---:|---:|---:|---:|---:|---:|
|
||
| 85:15 / 3 Kontrolle | 57,39 | 75,37 | 1907,30 | 59,96 | 15860 | 10646 |
|
||
| 85:15 / 2 | 63,32 | 75,35 | 1906,40 | 59,85 | 15592 | 10614 |
|
||
| 85:15 / 4 | 51,36 | 78,87 | 1813,80 | 50,33 | 15872 | 10420 |
|
||
| 83:17 / 3 | 57,54 | 73,99 | 1930,21 | 56,12 | 15274 | 11230 |
|
||
|
||
## Einordnung
|
||
|
||
MTP2 ist der interessanteste Folgekandidat: +10,3 % beim deutschen Text,
|
||
praktisch gleiche Code-/24K-Raten und 268 MiB weniger gesampelte Spitzenbelegung
|
||
auf der 5080. MTP4 ist beim Code +4,6 %, aber bei Deutsch −10,5 % und beim Decode
|
||
nach 24K −16,1 %. 83:17 verschafft mehr Reserve auf der 5080, liefert aber keinen
|
||
klaren Gesamtgewinn und belegt die langsamere 3060 stärker.
|
||
|
||
Dies sind je ein Lauf und unterschiedliche erzeugte Tokenfolgen. Identische
|
||
Prompts, Samplingwerte und Seeds erzwingen über veränderte MTP-/GPU-Konfigurationen
|
||
keine identischen Antworten. Die Werte sind keine isolierten Messungen derselben
|
||
Tokenfolge und kein Nachweis eines allgemeinen 10-%-Gewinns.
|
||
|
||
Alle vier Läufe finden die drei eingebetteten Fakten korrekt (3/3). Modellgewichte
|
||
und Quantisierung unverändert. Keine allgemeine Qualitätsgleichheit nachgewiesen:
|
||
Die beiden Decode-Aufgaben wurden absichtlich bei 768 Ausgabetokens begrenzt
|
||
(`finish_reason=length`); kein vollständiger Code-Test oder breiter Qualitätstest.
|
||
Die Recall-Ausgaben enthalten korrekte Werte, aber auch überflüssige Erläuterungen.
|
||
Keine Vision-, Parallelitäts- oder volle160K-Prüfung; größte tatsächliche Eingabe
|
||
24.674 Tokens, gefolgt von512 Ausgabetokens. Kein höheres Kontextmaximum ermittelt.
|
||
|
||
## Sicherheit und Reproduzierbarkeit
|
||
|
||
Runner kopiert die echten Produktionsargumente. Variiert werden nur Microbatch,
|
||
Split, MTP-Tiefe sowie isolierter Port/Host und Log-Verbosity. Der neue Kontrolllauf
|
||
ist für diesen direkten Vergleich erforderlich, keine Wiederholung der breiten
|
||
archivierten Qwen-Modellreferenz. Kein Prompt-Cache in den Messanfragen.
|
||
|
||
Nach laufenden Anfragen erfolgte ein begrenzter Testbetrieb mit automatischer
|
||
Wiederherstellung. 448MiB Mindestreserve nach Laden, 85°C Temperatur- und3GiB
|
||
Host-RAM-Grenze. Container26GiB RAM ohne zusätzliches Swapbudget; keine Host-,
|
||
Treiber-, Netzwerk- oder Kerneländerungen. Maximal75°C5080/58°C3060 gemessen.
|
||
PCIe unter Last: 5080Gen4x16, 3060Gen3x4. Keine Kernel-/Xid-/OOM-Kill-Meldungen.
|
||
Router/Medium/Controller/Gateway/TTS danach gesund, readiness und OK-Antwort bestanden.
|
||
|
||
Rohdaten einschließlich Antworten, tatsächlichen Argumenten, GPU-Samples und
|
||
komprimierten Serverlogs: `experiments/medium-split-mtp-20260920/`.
|
||
Athena: `/data/benchmarks/medium-split-mtp-20260920/`.
|
||
|
||
Empfehlung: vor dauerhafter Umstellung MTP2/Microbatch256 mit vollständigen
|
||
Qualitätsantworten und relevanter Langkontext-/Visionlast prüfen. Kein automatischer
|
||
Folgetest und keine Produktionsumstellung durch diesen Kurzvergleich.
|