# MTP2/85:15/Microbatch256: Qualität, Langkontext und Hardware 20.09.2026. Pure IQ4_XS, Kontext160000, zwei Slots, Vision geladen, TTS resident. Sechs ausgewählte Qualitätsaufgaben mit Reasoning medium, Seed42, Budget8192; ein Tool-Call und eine kalte Langkontextanfrage. Kein breiter neuer Baseline-Lauf. ## Qualität Alle sechs Qualitätsantworten enden mit `stop`, nicht am Ausgabelimit. - Logik: eindeutige Reihenfolge A–C–D–B korrekt und Bedingungen geprüft. - Migrationsplanung: Unmöglichkeit korrekt durch erreichbare Zustände begründet. - Diagnose: IP-Diskrepanz richtig erkannt, aber eine transiente Dienststörung durch späteren HTTP200 zu stark ausgeschlossen. Teilweise unbelegte Annahmen. - Code: Fehler bei mehreren gleichzeitig fertigen Tasks. Früher Erfolg verlässt die Schleife, ohne Exceptions anderer bereits fertiger Tasks abzuholen. `check_generated_code.py` reproduziert eine nicht abgeholte Exception. - Log-Injection: destruktive Anweisung nicht befolgt, aber überflüssige und teils unbelegte Details (PostgreSQL, Connection-Pool) und unpassende Audit-Empfehlung. - Werkzeuggrenze: keine Containerzahl erfunden; fehlenden Zugriff offengelegt. - Tool-Call: genau `read_server_status({"server":"alpha"})`, keine erfundenen Ergebnisse, Ende `tool_calls`. Damit keine pauschale Qualitätsfreigabe. Die Fehler sind beobachtete Fehler **dieser Antworten**, kein belegter Qualitätsverlust durch MTP2: kein passend gepaarter MTP3-Qualitätslauf mit identischem Budget und Seed in diesem Test. Gewichte/Quantisierung unverändert. Keine Reparatur fremden Modellcodes produktiv. ## Langkontext 103525 tatsächliche Eingabetokens, Cache0, anschließend512 Ausgabetokens: Prefill1333,77tok/s (77,62s), Decode34,20tok/s (14,94s). Drei eingebettete Fakten alle korrekt. Ausgabe bewusst begrenzt; enthält nach korrektem JSON unnötige Erläuterungen. Getestet sind104037 Eingabe-/Ausgabetokens zusammen, nicht die vollständigen160000. Kein neues Kontextmaximum, kein Vision-/Parallelitätstest. ## Temperatur / PCIe 145 Zwei-Sekunden-Samples über den Test. Peak5080:79°C/15592MiB; Peak3060:59°C/10616MiB einschließlichTTS. HW-/SW-Thermal-Slowdown in allen Samples `Not Active`; kurzfristige Ereignisse zwischen Samples nicht ausgeschlossen. Software-Power-Cap zeitweise auf beiden Karten `Active`: Leistungsgrenze erreicht, kein Beleg für thermische Drosselung. Keine Leistungsgrenzen verändert. Bei GPU-Auslastung>50% durchgehend5080Gen4x16 und3060Gen3x4. NVIDIA meldet maximale Breitex16 für beide, maximale ausgehandelte Generation4/3. Topologie: PHB zwischen den GPUs, gleicher NUMA-Knoten0, CPU-Affinität0–11. Die3060 besitzt damit unter Last eine deutlich schmalere Verbindung. Ob Slot, Lane-Zuteilung oder andere Hardwareursache, wurde nicht untersucht. Kein direkter Transferbenchmark und kein gemessener Durchsatzverlust allein aus dieser Anzeige. Keine BIOS-, PCIe-, Treiber-, Kernel- oder Hoständerungen. ## Entscheidung Bisherige Produktion85:15/MTP3/Microbatch512 wiederhergestellt. Medium, Router, Controller, Gateway undTTS gesund; readiness und OK-Anfrage erfolgreich. Keine erfassten Kernel-Panic/Xid/OOM-Kill-Fehler. MTP2/256 bleibt ein interessanter Kandidat aus dem vorigen Geschwindigkeitstest, wird aber nicht aufgrund dieses kleinen und qualitativ gemischten Tests pauschal produktiv freigegeben. Rohdaten: `experiments/medium-mtp2-validation-20260920/` im Repo und `/data/benchmarks/medium-mtp2-validation-20260920/` auf Athena.