Files
AI-Profile-Router/docs/MEDIUM_SPLIT_MTP_20260920.md
T

56 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Medium: GPU-Split und MTP – Kurzvergleich 20.09.2026
Vier isolierte Läufe mit Pure IQ4_XS, 160.000 konfigurierten Kontexttokens,
zwei Slots, Vision geladen, TTS auf der 3060, Microbatch 256. Produktionsprofil
nachher unverändert wiederhergestellt (85:15, MTP3, Microbatch512).
| Split 5080:3060 / MTP | Deutsch tok/s | Code tok/s | 24K Prefill tok/s | Decode nach 24K tok/s | Peak 5080 MiB | Peak 3060 MiB |
|---|---:|---:|---:|---:|---:|---:|
| 85:15 / 3 Kontrolle | 57,39 | 75,37 | 1907,30 | 59,96 | 15860 | 10646 |
| 85:15 / 2 | 63,32 | 75,35 | 1906,40 | 59,85 | 15592 | 10614 |
| 85:15 / 4 | 51,36 | 78,87 | 1813,80 | 50,33 | 15872 | 10420 |
| 83:17 / 3 | 57,54 | 73,99 | 1930,21 | 56,12 | 15274 | 11230 |
## Einordnung
MTP2 ist der interessanteste Folgekandidat: +10,3 % beim deutschen Text,
praktisch gleiche Code-/24K-Raten und 268 MiB weniger gesampelte Spitzenbelegung
auf der 5080. MTP4 ist beim Code +4,6 %, aber bei Deutsch −10,5 % und beim Decode
nach 24K −16,1 %. 83:17 verschafft mehr Reserve auf der 5080, liefert aber keinen
klaren Gesamtgewinn und belegt die langsamere 3060 stärker.
Dies sind je ein Lauf und unterschiedliche erzeugte Tokenfolgen. Identische
Prompts, Samplingwerte und Seeds erzwingen über veränderte MTP-/GPU-Konfigurationen
keine identischen Antworten. Die Werte sind keine isolierten Messungen derselben
Tokenfolge und kein Nachweis eines allgemeinen 10-%-Gewinns.
Alle vier Läufe finden die drei eingebetteten Fakten korrekt (3/3). Modellgewichte
und Quantisierung unverändert. Keine allgemeine Qualitätsgleichheit nachgewiesen:
Die beiden Decode-Aufgaben wurden absichtlich bei 768 Ausgabetokens begrenzt
(`finish_reason=length`); kein vollständiger Code-Test oder breiter Qualitätstest.
Die Recall-Ausgaben enthalten korrekte Werte, aber auch überflüssige Erläuterungen.
Keine Vision-, Parallelitäts- oder volle160K-Prüfung; größte tatsächliche Eingabe
24.674 Tokens, gefolgt von512 Ausgabetokens. Kein höheres Kontextmaximum ermittelt.
## Sicherheit und Reproduzierbarkeit
Runner kopiert die echten Produktionsargumente. Variiert werden nur Microbatch,
Split, MTP-Tiefe sowie isolierter Port/Host und Log-Verbosity. Der neue Kontrolllauf
ist für diesen direkten Vergleich erforderlich, keine Wiederholung der breiten
archivierten Qwen-Modellreferenz. Kein Prompt-Cache in den Messanfragen.
Nach laufenden Anfragen erfolgte ein begrenzter Testbetrieb mit automatischer
Wiederherstellung. 448MiB Mindestreserve nach Laden, 85°C Temperatur- und3GiB
Host-RAM-Grenze. Container26GiB RAM ohne zusätzliches Swapbudget; keine Host-,
Treiber-, Netzwerk- oder Kerneländerungen. Maximal75°C5080/58°C3060 gemessen.
PCIe unter Last: 5080Gen4x16, 3060Gen3x4. Keine Kernel-/Xid-/OOM-Kill-Meldungen.
Router/Medium/Controller/Gateway/TTS danach gesund, readiness und OK-Antwort bestanden.
Rohdaten einschließlich Antworten, tatsächlichen Argumenten, GPU-Samples und
komprimierten Serverlogs: `experiments/medium-split-mtp-20260920/`.
Athena: `/data/benchmarks/medium-split-mtp-20260920/`.
Empfehlung: vor dauerhafter Umstellung MTP2/Microbatch256 mit vollständigen
Qualitätsantworten und relevanter Langkontext-/Visionlast prüfen. Kein automatischer
Folgetest und keine Produktionsumstellung durch diesen Kurzvergleich.