Validate Medium microbatch 256 with authorized lower reserve
This commit is contained in:
@@ -0,0 +1,52 @@
|
||||
# Medium Microbatch 256: Kurztest mit reduzierter Reserve
|
||||
|
||||
20.09.2026. **Nach ausdrücklicher Freigabe wurde die Startreserve ausschließlich
|
||||
für diesen Test von 512 auf 448 MiB gesenkt. Microbatch 256 besteht die kurzen
|
||||
Inferenztests.** Die übrigen Schutzmaßnahmen blieben aktiv.
|
||||
|
||||
Nach Laden waren 461 MiB auf der 5080 frei. Die neue Grenze erlaubt diesen Fall;
|
||||
es ist eine Freigabeprüfung nach dem Laden, kein dynamisch reservierter
|
||||
Speicherblock. Während der Messung sank der gesampelte freie Speicher auf 443 MiB.
|
||||
Keine weitere Absenkung war nötig. Andere Testkonfigurationen behalten ihre
|
||||
bisherigen Grenzen; am NVIDIA-Treiber oder am Produktivprofil wurde nichts geändert.
|
||||
|
||||
## Vergleich zum unmittelbar vorherigen 512-Kontrolllauf
|
||||
|
||||
| Aufgabe | Microbatch 512 | Microbatch 256 | Änderung |
|
||||
|---|---:|---:|---:|
|
||||
| Deutsch, 768 Ausgabetokens | 57,2 tok/s | 57,5 tok/s | +0,6 % |
|
||||
| Code, 768 Ausgabetokens | 74,9 tok/s | 75,5 tok/s | +0,7 % |
|
||||
| Prefill, 24.674 Eingabetokens | 1.782,0 tok/s | 1.909,2 tok/s | +7,1 % |
|
||||
| Ausgabe nach 24K, 512 Tokens | 54,8 tok/s | 60,0 tok/s | +9,6 % |
|
||||
| Synthetischer Fakten-Recall | 3/3 | 3/3 | gleich |
|
||||
|
||||
Die kurzen Deutsch-/Code-Ausgabetexte sind zwischen den Armen identisch.
|
||||
Die Recall-Aufgabe hat denselben korrekten Faktenfund, aber unterschiedlichen
|
||||
anschließenden Erklärungstext. Insbesondere der 9,6-%-Decode-Unterschied ist daher
|
||||
kein isolierter Vergleich identischer Tokenfolgen. Ein Lauf je Konfiguration;
|
||||
kleine Unterschiede können Messschwankungen sein. Keine allgemeine Qualitäts-
|
||||
oder Geschwindigkeitsgarantie.
|
||||
|
||||
Pure, 160K Kontext, zwei Slots, 85:15-Split, Vision geladen, MTP3 und alle übrigen
|
||||
Modellargumente blieben wie beim 512-Kontrolllauf. Die Reserve selbst verändert
|
||||
die Inferenzberechnung nicht. Die maximal tatsächlich geprüfte Eingabe war 24.674
|
||||
Tokens; keine 160K- oder Bildanfrage und keine parallele Last getestet.
|
||||
|
||||
Die bisherige Pufferfehler-/Pipeline-Rückfallmeldung erschien bei 256 nicht.
|
||||
Das belegt einen Start ohne diesen Rückfall, aber nicht allein eine bestimmte
|
||||
Pipeline-Auslastung. Peak: 5080 bei 15.860 MiB, 3060 einschließlich TTS bei 10.648 MiB.
|
||||
|
||||
## Einordnung und Abschluss
|
||||
|
||||
Die vorherige 512-MiB-Grenze war für diesen Kurztest zu konservativ: 461 MiB freie
|
||||
Startreserve reichten tatsächlich für alle drei Aufgaben. Daraus folgt nicht,
|
||||
dass diese Reserve für jede 160K-/Vision-/Mehrnutzerlast genügt.
|
||||
|
||||
**256 ist ein sinnvoller Kandidat für besseres Prefill, kein großer Decode-Sprung.**
|
||||
Für eine dauerhafte Umstellung fehlen noch passende Langkontext-/Vision- und
|
||||
Parallelitätsprüfungen; diese wurden heute nicht automatisch angeschlossen.
|
||||
|
||||
Das bisherige Medium mit Microbatch 512 ist wiederhergestellt. Medium, Router,
|
||||
Controller, Gateway und TTS gesund; readiness und minimale Modellantwort geprüft.
|
||||
Keine erfassten Kernel-Panic-, Xid-, OOM-Kill- oder GPU-fallen-off-Meldungen seit
|
||||
Testbeginn. Rohdaten und Prüfbelege unter `experiments/medium-microbatch-20260920/`.
|
||||
Reference in New Issue
Block a user