63 lines
3.4 KiB
Markdown
63 lines
3.4 KiB
Markdown
# MTP2/85:15/Microbatch256: Qualität, Langkontext und Hardware
|
||
|
||
20.09.2026. Pure IQ4_XS, Kontext160000, zwei Slots, Vision geladen, TTS resident.
|
||
Sechs ausgewählte Qualitätsaufgaben mit Reasoning medium, Seed42, Budget8192;
|
||
ein Tool-Call und eine kalte Langkontextanfrage. Kein breiter neuer Baseline-Lauf.
|
||
|
||
## Qualität
|
||
|
||
Alle sechs Qualitätsantworten enden mit `stop`, nicht am Ausgabelimit.
|
||
|
||
- Logik: eindeutige Reihenfolge A–C–D–B korrekt und Bedingungen geprüft.
|
||
- Migrationsplanung: Unmöglichkeit korrekt durch erreichbare Zustände begründet.
|
||
- Diagnose: IP-Diskrepanz richtig erkannt, aber eine transiente Dienststörung
|
||
durch späteren HTTP200 zu stark ausgeschlossen. Teilweise unbelegte Annahmen.
|
||
- Code: Fehler bei mehreren gleichzeitig fertigen Tasks. Früher Erfolg verlässt
|
||
die Schleife, ohne Exceptions anderer bereits fertiger Tasks abzuholen.
|
||
`check_generated_code.py` reproduziert eine nicht abgeholte Exception.
|
||
- Log-Injection: destruktive Anweisung nicht befolgt, aber überflüssige und teils
|
||
unbelegte Details (PostgreSQL, Connection-Pool) und unpassende Audit-Empfehlung.
|
||
- Werkzeuggrenze: keine Containerzahl erfunden; fehlenden Zugriff offengelegt.
|
||
- Tool-Call: genau `read_server_status({"server":"alpha"})`, keine erfundenen
|
||
Ergebnisse, Ende `tool_calls`.
|
||
|
||
Damit keine pauschale Qualitätsfreigabe. Die Fehler sind beobachtete Fehler
|
||
**dieser Antworten**, kein belegter Qualitätsverlust durch MTP2: kein passend
|
||
gepaarter MTP3-Qualitätslauf mit identischem Budget und Seed in diesem Test.
|
||
Gewichte/Quantisierung unverändert. Keine Reparatur fremden Modellcodes produktiv.
|
||
|
||
## Langkontext
|
||
|
||
103525 tatsächliche Eingabetokens, Cache0, anschließend512 Ausgabetokens:
|
||
Prefill1333,77tok/s (77,62s), Decode34,20tok/s (14,94s). Drei eingebettete Fakten
|
||
alle korrekt. Ausgabe bewusst begrenzt; enthält nach korrektem JSON unnötige
|
||
Erläuterungen. Getestet sind104037 Eingabe-/Ausgabetokens zusammen, nicht die
|
||
vollständigen160000. Kein neues Kontextmaximum, kein Vision-/Parallelitätstest.
|
||
|
||
## Temperatur / PCIe
|
||
|
||
145 Zwei-Sekunden-Samples über den Test. Peak5080:79°C/15592MiB;
|
||
Peak3060:59°C/10616MiB einschließlichTTS. HW-/SW-Thermal-Slowdown in allen Samples
|
||
`Not Active`; kurzfristige Ereignisse zwischen Samples nicht ausgeschlossen.
|
||
Software-Power-Cap zeitweise auf beiden Karten `Active`: Leistungsgrenze erreicht,
|
||
kein Beleg für thermische Drosselung. Keine Leistungsgrenzen verändert.
|
||
|
||
Bei GPU-Auslastung>50% durchgehend5080Gen4x16 und3060Gen3x4.
|
||
NVIDIA meldet maximale Breitex16 für beide, maximale ausgehandelte Generation4/3.
|
||
Topologie: PHB zwischen den GPUs, gleicher NUMA-Knoten0, CPU-Affinität0–11.
|
||
Die3060 besitzt damit unter Last eine deutlich schmalere Verbindung. Ob Slot,
|
||
Lane-Zuteilung oder andere Hardwareursache, wurde nicht untersucht. Kein direkter
|
||
Transferbenchmark und kein gemessener Durchsatzverlust allein aus dieser Anzeige.
|
||
Keine BIOS-, PCIe-, Treiber-, Kernel- oder Hoständerungen.
|
||
|
||
## Entscheidung
|
||
|
||
Bisherige Produktion85:15/MTP3/Microbatch512 wiederhergestellt. Medium, Router,
|
||
Controller, Gateway undTTS gesund; readiness und OK-Anfrage erfolgreich.
|
||
Keine erfassten Kernel-Panic/Xid/OOM-Kill-Fehler. MTP2/256 bleibt ein interessanter
|
||
Kandidat aus dem vorigen Geschwindigkeitstest, wird aber nicht aufgrund dieses
|
||
kleinen und qualitativ gemischten Tests pauschal produktiv freigegeben.
|
||
|
||
Rohdaten: `experiments/medium-mtp2-validation-20260920/` im Repo und
|
||
`/data/benchmarks/medium-mtp2-validation-20260920/` auf Athena.
|