Record bounded Medium GPU split and MTP comparison
This commit is contained in:
@@ -47,3 +47,12 @@ Ein-Slot-Folgeversuche: [Bericht](DFLASH2_ONE_SLOT_20260920.md). Draft auf 5080
|
||||
[512 gegen 256](MEDIUM_MICROBATCH_20260920.md): 256 lädt ohne vorherige Pufferfehler-Meldung, lässt aber nur 461 MiB auf der 5080 frei. Schutzabbruch vor Inferenz; kein Geschwindigkeitsgewinn belegt. 512 wiederhergestellt. Für einen eventuellen Folgetest zuerst mehr 5080-Reserve durch angepassten Split schaffen.
|
||||
|
||||
Nach expliziter Freigabe: [Reserve448-Folgetest](MEDIUM_MICROBATCH_RESERVE448_20260920.md) bestanden. 256 liefert +7,1 % Prefill im einmaligen 24K-Kurzvergleich; kurze Decodes nahezu gleich. Alle drei Fakten korrekt, keine volle Langkontext-/Vision-/Parallelitätsfreigabe. Produktiv weiter512.
|
||||
|
||||
## Punkt 2: GPU-Split/MTP-Kurzvergleich
|
||||
|
||||
[Vier Varianten getestet](MEDIUM_SPLIT_MTP_20260920.md): bei Microbatch256 ist
|
||||
85:15/MTP2 der interessanteste Kandidat (+10,3% Deutsch, Code/24K etwa gleich,
|
||||
268MiB weniger Peak5080). MTP4 und83:17 ohne allgemeinen Vorteil. Je ein Lauf,
|
||||
unterschiedliche Texte, Recall überall3/3; breite Qualität und lange/visuelle/
|
||||
parallele Last offen. Produktiv weiterhin85:15/MTP3/Microbatch512. Punkt2 teilweise
|
||||
bearbeitet, keine pauschale Freigabe oder höhere Kontextgrenze.
|
||||
|
||||
@@ -0,0 +1,55 @@
|
||||
# Medium: GPU-Split und MTP – Kurzvergleich 20.09.2026
|
||||
|
||||
Vier isolierte Läufe mit Pure IQ4_XS, 160.000 konfigurierten Kontexttokens,
|
||||
zwei Slots, Vision geladen, TTS auf der 3060, Microbatch 256. Produktionsprofil
|
||||
nachher unverändert wiederhergestellt (85:15, MTP3, Microbatch512).
|
||||
|
||||
| Split 5080:3060 / MTP | Deutsch tok/s | Code tok/s | 24K Prefill tok/s | Decode nach 24K tok/s | Peak 5080 MiB | Peak 3060 MiB |
|
||||
|---|---:|---:|---:|---:|---:|---:|
|
||||
| 85:15 / 3 Kontrolle | 57,39 | 75,37 | 1907,30 | 59,96 | 15860 | 10646 |
|
||||
| 85:15 / 2 | 63,32 | 75,35 | 1906,40 | 59,85 | 15592 | 10614 |
|
||||
| 85:15 / 4 | 51,36 | 78,87 | 1813,80 | 50,33 | 15872 | 10420 |
|
||||
| 83:17 / 3 | 57,54 | 73,99 | 1930,21 | 56,12 | 15274 | 11230 |
|
||||
|
||||
## Einordnung
|
||||
|
||||
MTP2 ist der interessanteste Folgekandidat: +10,3 % beim deutschen Text,
|
||||
praktisch gleiche Code-/24K-Raten und 268 MiB weniger gesampelte Spitzenbelegung
|
||||
auf der 5080. MTP4 ist beim Code +4,6 %, aber bei Deutsch −10,5 % und beim Decode
|
||||
nach 24K −16,1 %. 83:17 verschafft mehr Reserve auf der 5080, liefert aber keinen
|
||||
klaren Gesamtgewinn und belegt die langsamere 3060 stärker.
|
||||
|
||||
Dies sind je ein Lauf und unterschiedliche erzeugte Tokenfolgen. Identische
|
||||
Prompts, Samplingwerte und Seeds erzwingen über veränderte MTP-/GPU-Konfigurationen
|
||||
keine identischen Antworten. Die Werte sind keine isolierten Messungen derselben
|
||||
Tokenfolge und kein Nachweis eines allgemeinen 10-%-Gewinns.
|
||||
|
||||
Alle vier Läufe finden die drei eingebetteten Fakten korrekt (3/3). Modellgewichte
|
||||
und Quantisierung unverändert. Keine allgemeine Qualitätsgleichheit nachgewiesen:
|
||||
Die beiden Decode-Aufgaben wurden absichtlich bei 768 Ausgabetokens begrenzt
|
||||
(`finish_reason=length`); kein vollständiger Code-Test oder breiter Qualitätstest.
|
||||
Die Recall-Ausgaben enthalten korrekte Werte, aber auch überflüssige Erläuterungen.
|
||||
Keine Vision-, Parallelitäts- oder volle160K-Prüfung; größte tatsächliche Eingabe
|
||||
24.674 Tokens, gefolgt von512 Ausgabetokens. Kein höheres Kontextmaximum ermittelt.
|
||||
|
||||
## Sicherheit und Reproduzierbarkeit
|
||||
|
||||
Runner kopiert die echten Produktionsargumente. Variiert werden nur Microbatch,
|
||||
Split, MTP-Tiefe sowie isolierter Port/Host und Log-Verbosity. Der neue Kontrolllauf
|
||||
ist für diesen direkten Vergleich erforderlich, keine Wiederholung der breiten
|
||||
archivierten Qwen-Modellreferenz. Kein Prompt-Cache in den Messanfragen.
|
||||
|
||||
Nach laufenden Anfragen erfolgte ein begrenzter Testbetrieb mit automatischer
|
||||
Wiederherstellung. 448MiB Mindestreserve nach Laden, 85°C Temperatur- und3GiB
|
||||
Host-RAM-Grenze. Container26GiB RAM ohne zusätzliches Swapbudget; keine Host-,
|
||||
Treiber-, Netzwerk- oder Kerneländerungen. Maximal75°C5080/58°C3060 gemessen.
|
||||
PCIe unter Last: 5080Gen4x16, 3060Gen3x4. Keine Kernel-/Xid-/OOM-Kill-Meldungen.
|
||||
Router/Medium/Controller/Gateway/TTS danach gesund, readiness und OK-Antwort bestanden.
|
||||
|
||||
Rohdaten einschließlich Antworten, tatsächlichen Argumenten, GPU-Samples und
|
||||
komprimierten Serverlogs: `experiments/medium-split-mtp-20260920/`.
|
||||
Athena: `/data/benchmarks/medium-split-mtp-20260920/`.
|
||||
|
||||
Empfehlung: vor dauerhafter Umstellung MTP2/Microbatch256 mit vollständigen
|
||||
Qualitätsantworten und relevanter Langkontext-/Visionlast prüfen. Kein automatischer
|
||||
Folgetest und keine Produktionsumstellung durch diesen Kurzvergleich.
|
||||
Reference in New Issue
Block a user