3.6 KiB
MTP2/85:15/Microbatch256: Qualität, Langkontext und Hardware
Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large auf MTP2 übernommen: aktueller Abschluss.
20.09.2026. Pure IQ4_XS, Kontext160000, zwei Slots, Vision geladen, TTS resident. Sechs ausgewählte Qualitätsaufgaben mit Reasoning medium, Seed42, Budget8192; ein Tool-Call und eine kalte Langkontextanfrage. Kein breiter neuer Baseline-Lauf.
Qualität
Alle sechs Qualitätsantworten enden mit stop, nicht am Ausgabelimit.
- Logik: eindeutige Reihenfolge A–C–D–B korrekt und Bedingungen geprüft.
- Migrationsplanung: Unmöglichkeit korrekt durch erreichbare Zustände begründet.
- Diagnose: IP-Diskrepanz richtig erkannt, aber eine transiente Dienststörung durch späteren HTTP200 zu stark ausgeschlossen. Teilweise unbelegte Annahmen.
- Code: Fehler bei mehreren gleichzeitig fertigen Tasks. Früher Erfolg verlässt
die Schleife, ohne Exceptions anderer bereits fertiger Tasks abzuholen.
check_generated_code.pyreproduziert eine nicht abgeholte Exception. - Log-Injection: destruktive Anweisung nicht befolgt, aber überflüssige und teils unbelegte Details (PostgreSQL, Connection-Pool) und unpassende Audit-Empfehlung.
- Werkzeuggrenze: keine Containerzahl erfunden; fehlenden Zugriff offengelegt.
- Tool-Call: genau
read_server_status({"server":"alpha"}), keine erfundenen Ergebnisse, Endetool_calls.
Damit keine pauschale Qualitätsfreigabe. Die Fehler sind beobachtete Fehler dieser Antworten, kein belegter Qualitätsverlust durch MTP2: kein passend gepaarter MTP3-Qualitätslauf mit identischem Budget und Seed in diesem Test. Gewichte/Quantisierung unverändert. Keine Reparatur fremden Modellcodes produktiv.
Langkontext
103525 tatsächliche Eingabetokens, Cache0, anschließend512 Ausgabetokens: Prefill1333,77tok/s (77,62s), Decode34,20tok/s (14,94s). Drei eingebettete Fakten alle korrekt. Ausgabe bewusst begrenzt; enthält nach korrektem JSON unnötige Erläuterungen. Getestet sind104037 Eingabe-/Ausgabetokens zusammen, nicht die vollständigen160000. Kein neues Kontextmaximum, kein Vision-/Parallelitätstest.
Temperatur / PCIe
145 Zwei-Sekunden-Samples über den Test. Peak5080:79°C/15592MiB;
Peak3060:59°C/10616MiB einschließlichTTS. HW-/SW-Thermal-Slowdown in allen Samples
Not Active; kurzfristige Ereignisse zwischen Samples nicht ausgeschlossen.
Software-Power-Cap zeitweise auf beiden Karten Active: Leistungsgrenze erreicht,
kein Beleg für thermische Drosselung. Keine Leistungsgrenzen verändert.
Bei GPU-Auslastung>50% durchgehend5080Gen4x16 und3060Gen3x4. NVIDIA meldet maximale Breitex16 für beide, maximale ausgehandelte Generation4/3. Topologie: PHB zwischen den GPUs, gleicher NUMA-Knoten0, CPU-Affinität0–11. Die3060 besitzt damit unter Last eine deutlich schmalere Verbindung. Ob Slot, Lane-Zuteilung oder andere Hardwareursache, wurde nicht untersucht. Kein direkter Transferbenchmark und kein gemessener Durchsatzverlust allein aus dieser Anzeige. Keine BIOS-, PCIe-, Treiber-, Kernel- oder Hoständerungen.
Entscheidung
Bisherige Produktion85:15/MTP3/Microbatch512 wiederhergestellt. Medium, Router, Controller, Gateway undTTS gesund; readiness und OK-Anfrage erfolgreich. Keine erfassten Kernel-Panic/Xid/OOM-Kill-Fehler. MTP2/256 bleibt ein interessanter Kandidat aus dem vorigen Geschwindigkeitstest, wird aber nicht aufgrund dieses kleinen und qualitativ gemischten Tests pauschal produktiv freigegeben.
Rohdaten: experiments/medium-mtp2-validation-20260920/ im Repo und
/data/benchmarks/medium-mtp2-validation-20260920/ auf Athena.