Record bounded Medium GPU split and MTP comparison

This commit is contained in:
Mikei386
2026-09-20 22:42:09 +02:00
parent 3cbcf41fab
commit 635b3c4ba9
32 changed files with 5107 additions and 0 deletions
@@ -47,3 +47,12 @@ Ein-Slot-Folgeversuche: [Bericht](DFLASH2_ONE_SLOT_20260920.md). Draft auf 5080
[512 gegen 256](MEDIUM_MICROBATCH_20260920.md): 256 lädt ohne vorherige Pufferfehler-Meldung, lässt aber nur 461 MiB auf der 5080 frei. Schutzabbruch vor Inferenz; kein Geschwindigkeitsgewinn belegt. 512 wiederhergestellt. Für einen eventuellen Folgetest zuerst mehr 5080-Reserve durch angepassten Split schaffen.
Nach expliziter Freigabe: [Reserve448-Folgetest](MEDIUM_MICROBATCH_RESERVE448_20260920.md) bestanden. 256 liefert +7,1 % Prefill im einmaligen 24K-Kurzvergleich; kurze Decodes nahezu gleich. Alle drei Fakten korrekt, keine volle Langkontext-/Vision-/Parallelitätsfreigabe. Produktiv weiter512.
## Punkt 2: GPU-Split/MTP-Kurzvergleich
[Vier Varianten getestet](MEDIUM_SPLIT_MTP_20260920.md): bei Microbatch256 ist
85:15/MTP2 der interessanteste Kandidat (+10,3% Deutsch, Code/24K etwa gleich,
268MiB weniger Peak5080). MTP4 und83:17 ohne allgemeinen Vorteil. Je ein Lauf,
unterschiedliche Texte, Recall überall3/3; breite Qualität und lange/visuelle/
parallele Last offen. Produktiv weiterhin85:15/MTP3/Microbatch512. Punkt2 teilweise
bearbeitet, keine pauschale Freigabe oder höhere Kontextgrenze.