Files
AI-Profile-Router/docs/MEDIUM_MICROBATCH_RESERVE448_20260920.md
T

53 lines
2.9 KiB
Markdown

# Medium Microbatch 256: Kurztest mit reduzierter Reserve
20.09.2026. **Nach ausdrücklicher Freigabe wurde die Startreserve ausschließlich
für diesen Test von 512 auf 448 MiB gesenkt. Microbatch 256 besteht die kurzen
Inferenztests.** Die übrigen Schutzmaßnahmen blieben aktiv.
Nach Laden waren 461 MiB auf der 5080 frei. Die neue Grenze erlaubt diesen Fall;
es ist eine Freigabeprüfung nach dem Laden, kein dynamisch reservierter
Speicherblock. Während der Messung sank der gesampelte freie Speicher auf 443 MiB.
Keine weitere Absenkung war nötig. Andere Testkonfigurationen behalten ihre
bisherigen Grenzen; am NVIDIA-Treiber oder am Produktivprofil wurde nichts geändert.
## Vergleich zum unmittelbar vorherigen 512-Kontrolllauf
| Aufgabe | Microbatch 512 | Microbatch 256 | Änderung |
|---|---:|---:|---:|
| Deutsch, 768 Ausgabetokens | 57,2 tok/s | 57,5 tok/s | +0,6 % |
| Code, 768 Ausgabetokens | 74,9 tok/s | 75,5 tok/s | +0,7 % |
| Prefill, 24.674 Eingabetokens | 1.782,0 tok/s | 1.909,2 tok/s | +7,1 % |
| Ausgabe nach 24K, 512 Tokens | 54,8 tok/s | 60,0 tok/s | +9,6 % |
| Synthetischer Fakten-Recall | 3/3 | 3/3 | gleich |
Die kurzen Deutsch-/Code-Ausgabetexte sind zwischen den Armen identisch.
Die Recall-Aufgabe hat denselben korrekten Faktenfund, aber unterschiedlichen
anschließenden Erklärungstext. Insbesondere der 9,6-%-Decode-Unterschied ist daher
kein isolierter Vergleich identischer Tokenfolgen. Ein Lauf je Konfiguration;
kleine Unterschiede können Messschwankungen sein. Keine allgemeine Qualitäts-
oder Geschwindigkeitsgarantie.
Pure, 160K Kontext, zwei Slots, 85:15-Split, Vision geladen, MTP3 und alle übrigen
Modellargumente blieben wie beim 512-Kontrolllauf. Die Reserve selbst verändert
die Inferenzberechnung nicht. Die maximal tatsächlich geprüfte Eingabe war 24.674
Tokens; keine 160K- oder Bildanfrage und keine parallele Last getestet.
Die bisherige Pufferfehler-/Pipeline-Rückfallmeldung erschien bei 256 nicht.
Das belegt einen Start ohne diesen Rückfall, aber nicht allein eine bestimmte
Pipeline-Auslastung. Peak: 5080 bei 15.860 MiB, 3060 einschließlich TTS bei 10.648 MiB.
## Einordnung und Abschluss
Die vorherige 512-MiB-Grenze war für diesen Kurztest zu konservativ: 461 MiB freie
Startreserve reichten tatsächlich für alle drei Aufgaben. Daraus folgt nicht,
dass diese Reserve für jede 160K-/Vision-/Mehrnutzerlast genügt.
**256 ist ein sinnvoller Kandidat für besseres Prefill, kein großer Decode-Sprung.**
Für eine dauerhafte Umstellung fehlen noch passende Langkontext-/Vision- und
Parallelitätsprüfungen; diese wurden heute nicht automatisch angeschlossen.
Das bisherige Medium mit Microbatch 512 ist wiederhergestellt. Medium, Router,
Controller, Gateway und TTS gesund; readiness und minimale Modellantwort geprüft.
Keine erfassten Kernel-Panic-, Xid-, OOM-Kill- oder GPU-fallen-off-Meldungen seit
Testbeginn. Rohdaten und Prüfbelege unter `experiments/medium-microbatch-20260920/`.