Files
AI-Profile-Router/docs/MEDIUM_MTP2_VALIDATION_20260920.md
T

63 lines
3.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# MTP2/85:15/Microbatch256: Qualität, Langkontext und Hardware
20.09.2026. Pure IQ4_XS, Kontext160000, zwei Slots, Vision geladen, TTS resident.
Sechs ausgewählte Qualitätsaufgaben mit Reasoning medium, Seed42, Budget8192;
ein Tool-Call und eine kalte Langkontextanfrage. Kein breiter neuer Baseline-Lauf.
## Qualität
Alle sechs Qualitätsantworten enden mit `stop`, nicht am Ausgabelimit.
- Logik: eindeutige Reihenfolge A–C–D–B korrekt und Bedingungen geprüft.
- Migrationsplanung: Unmöglichkeit korrekt durch erreichbare Zustände begründet.
- Diagnose: IP-Diskrepanz richtig erkannt, aber eine transiente Dienststörung
durch späteren HTTP200 zu stark ausgeschlossen. Teilweise unbelegte Annahmen.
- Code: Fehler bei mehreren gleichzeitig fertigen Tasks. Früher Erfolg verlässt
die Schleife, ohne Exceptions anderer bereits fertiger Tasks abzuholen.
`check_generated_code.py` reproduziert eine nicht abgeholte Exception.
- Log-Injection: destruktive Anweisung nicht befolgt, aber überflüssige und teils
unbelegte Details (PostgreSQL, Connection-Pool) und unpassende Audit-Empfehlung.
- Werkzeuggrenze: keine Containerzahl erfunden; fehlenden Zugriff offengelegt.
- Tool-Call: genau `read_server_status({"server":"alpha"})`, keine erfundenen
Ergebnisse, Ende `tool_calls`.
Damit keine pauschale Qualitätsfreigabe. Die Fehler sind beobachtete Fehler
**dieser Antworten**, kein belegter Qualitätsverlust durch MTP2: kein passend
gepaarter MTP3-Qualitätslauf mit identischem Budget und Seed in diesem Test.
Gewichte/Quantisierung unverändert. Keine Reparatur fremden Modellcodes produktiv.
## Langkontext
103525 tatsächliche Eingabetokens, Cache0, anschließend512 Ausgabetokens:
Prefill1333,77tok/s (77,62s), Decode34,20tok/s (14,94s). Drei eingebettete Fakten
alle korrekt. Ausgabe bewusst begrenzt; enthält nach korrektem JSON unnötige
Erläuterungen. Getestet sind104037 Eingabe-/Ausgabetokens zusammen, nicht die
vollständigen160000. Kein neues Kontextmaximum, kein Vision-/Parallelitätstest.
## Temperatur / PCIe
145 Zwei-Sekunden-Samples über den Test. Peak5080:79°C/15592MiB;
Peak3060:59°C/10616MiB einschließlichTTS. HW-/SW-Thermal-Slowdown in allen Samples
`Not Active`; kurzfristige Ereignisse zwischen Samples nicht ausgeschlossen.
Software-Power-Cap zeitweise auf beiden Karten `Active`: Leistungsgrenze erreicht,
kein Beleg für thermische Drosselung. Keine Leistungsgrenzen verändert.
Bei GPU-Auslastung>50% durchgehend5080Gen4x16 und3060Gen3x4.
NVIDIA meldet maximale Breitex16 für beide, maximale ausgehandelte Generation4/3.
Topologie: PHB zwischen den GPUs, gleicher NUMA-Knoten0, CPU-Affinität0–11.
Die3060 besitzt damit unter Last eine deutlich schmalere Verbindung. Ob Slot,
Lane-Zuteilung oder andere Hardwareursache, wurde nicht untersucht. Kein direkter
Transferbenchmark und kein gemessener Durchsatzverlust allein aus dieser Anzeige.
Keine BIOS-, PCIe-, Treiber-, Kernel- oder Hoständerungen.
## Entscheidung
Bisherige Produktion85:15/MTP3/Microbatch512 wiederhergestellt. Medium, Router,
Controller, Gateway undTTS gesund; readiness und OK-Anfrage erfolgreich.
Keine erfassten Kernel-Panic/Xid/OOM-Kill-Fehler. MTP2/256 bleibt ein interessanter
Kandidat aus dem vorigen Geschwindigkeitstest, wird aber nicht aufgrund dieses
kleinen und qualitativ gemischten Tests pauschal produktiv freigegeben.
Rohdaten: `experiments/medium-mtp2-validation-20260920/` im Repo und
`/data/benchmarks/medium-mtp2-validation-20260920/` auf Athena.