53 lines
2.9 KiB
Markdown
53 lines
2.9 KiB
Markdown
# Medium Microbatch 256: Kurztest mit reduzierter Reserve
|
|
|
|
20.09.2026. **Nach ausdrücklicher Freigabe wurde die Startreserve ausschließlich
|
|
für diesen Test von 512 auf 448 MiB gesenkt. Microbatch 256 besteht die kurzen
|
|
Inferenztests.** Die übrigen Schutzmaßnahmen blieben aktiv.
|
|
|
|
Nach Laden waren 461 MiB auf der 5080 frei. Die neue Grenze erlaubt diesen Fall;
|
|
es ist eine Freigabeprüfung nach dem Laden, kein dynamisch reservierter
|
|
Speicherblock. Während der Messung sank der gesampelte freie Speicher auf 443 MiB.
|
|
Keine weitere Absenkung war nötig. Andere Testkonfigurationen behalten ihre
|
|
bisherigen Grenzen; am NVIDIA-Treiber oder am Produktivprofil wurde nichts geändert.
|
|
|
|
## Vergleich zum unmittelbar vorherigen 512-Kontrolllauf
|
|
|
|
| Aufgabe | Microbatch 512 | Microbatch 256 | Änderung |
|
|
|---|---:|---:|---:|
|
|
| Deutsch, 768 Ausgabetokens | 57,2 tok/s | 57,5 tok/s | +0,6 % |
|
|
| Code, 768 Ausgabetokens | 74,9 tok/s | 75,5 tok/s | +0,7 % |
|
|
| Prefill, 24.674 Eingabetokens | 1.782,0 tok/s | 1.909,2 tok/s | +7,1 % |
|
|
| Ausgabe nach 24K, 512 Tokens | 54,8 tok/s | 60,0 tok/s | +9,6 % |
|
|
| Synthetischer Fakten-Recall | 3/3 | 3/3 | gleich |
|
|
|
|
Die kurzen Deutsch-/Code-Ausgabetexte sind zwischen den Armen identisch.
|
|
Die Recall-Aufgabe hat denselben korrekten Faktenfund, aber unterschiedlichen
|
|
anschließenden Erklärungstext. Insbesondere der 9,6-%-Decode-Unterschied ist daher
|
|
kein isolierter Vergleich identischer Tokenfolgen. Ein Lauf je Konfiguration;
|
|
kleine Unterschiede können Messschwankungen sein. Keine allgemeine Qualitäts-
|
|
oder Geschwindigkeitsgarantie.
|
|
|
|
Pure, 160K Kontext, zwei Slots, 85:15-Split, Vision geladen, MTP3 und alle übrigen
|
|
Modellargumente blieben wie beim 512-Kontrolllauf. Die Reserve selbst verändert
|
|
die Inferenzberechnung nicht. Die maximal tatsächlich geprüfte Eingabe war 24.674
|
|
Tokens; keine 160K- oder Bildanfrage und keine parallele Last getestet.
|
|
|
|
Die bisherige Pufferfehler-/Pipeline-Rückfallmeldung erschien bei 256 nicht.
|
|
Das belegt einen Start ohne diesen Rückfall, aber nicht allein eine bestimmte
|
|
Pipeline-Auslastung. Peak: 5080 bei 15.860 MiB, 3060 einschließlich TTS bei 10.648 MiB.
|
|
|
|
## Einordnung und Abschluss
|
|
|
|
Die vorherige 512-MiB-Grenze war für diesen Kurztest zu konservativ: 461 MiB freie
|
|
Startreserve reichten tatsächlich für alle drei Aufgaben. Daraus folgt nicht,
|
|
dass diese Reserve für jede 160K-/Vision-/Mehrnutzerlast genügt.
|
|
|
|
**256 ist ein sinnvoller Kandidat für besseres Prefill, kein großer Decode-Sprung.**
|
|
Für eine dauerhafte Umstellung fehlen noch passende Langkontext-/Vision- und
|
|
Parallelitätsprüfungen; diese wurden heute nicht automatisch angeschlossen.
|
|
|
|
Das bisherige Medium mit Microbatch 512 ist wiederhergestellt. Medium, Router,
|
|
Controller, Gateway und TTS gesund; readiness und minimale Modellantwort geprüft.
|
|
Keine erfassten Kernel-Panic-, Xid-, OOM-Kill- oder GPU-fallen-off-Meldungen seit
|
|
Testbeginn. Rohdaten und Prüfbelege unter `experiments/medium-microbatch-20260920/`.
|