Validate MTP2 quality long context and GPU thermals

This commit is contained in:
Mikei386
2026-09-20 22:51:41 +02:00
parent 635b3c4ba9
commit 9e836cf5fd
15 changed files with 6063 additions and 0 deletions
@@ -56,3 +56,9 @@ Nach expliziter Freigabe: [Reserve448-Folgetest](MEDIUM_MICROBATCH_RESERVE448_20
unterschiedliche Texte, Recall überall3/3; breite Qualität und lange/visuelle/
parallele Last offen. Produktiv weiterhin85:15/MTP3/Microbatch512. Punkt2 teilweise
bearbeitet, keine pauschale Freigabe oder höhere Kontextgrenze.
[MTP2-Qualitäts-/103K-Folgetest und Hardwareprüfung](MEDIUM_MTP2_VALIDATION_20260920.md):
sechs vollständige Antworten, korrekter Tool-Call, Recall3/3. Konkreter Codefehler
und Schwächen in Evidenztreue; keine pauschale Qualitätsgleichheit bewiesen.
5080max79°C,3060max59°C, keine gesampelte thermische Drosselung. Lastlinks
Gen4x16/Gen3x4. Produktion unverändert wiederhergestellt; Punkt2 nicht voll freigegeben.
+62
View File
@@ -0,0 +1,62 @@
# MTP2/85:15/Microbatch256: Qualität, Langkontext und Hardware
20.09.2026. Pure IQ4_XS, Kontext160000, zwei Slots, Vision geladen, TTS resident.
Sechs ausgewählte Qualitätsaufgaben mit Reasoning medium, Seed42, Budget8192;
ein Tool-Call und eine kalte Langkontextanfrage. Kein breiter neuer Baseline-Lauf.
## Qualität
Alle sechs Qualitätsantworten enden mit `stop`, nicht am Ausgabelimit.
- Logik: eindeutige Reihenfolge A–C–D–B korrekt und Bedingungen geprüft.
- Migrationsplanung: Unmöglichkeit korrekt durch erreichbare Zustände begründet.
- Diagnose: IP-Diskrepanz richtig erkannt, aber eine transiente Dienststörung
durch späteren HTTP200 zu stark ausgeschlossen. Teilweise unbelegte Annahmen.
- Code: Fehler bei mehreren gleichzeitig fertigen Tasks. Früher Erfolg verlässt
die Schleife, ohne Exceptions anderer bereits fertiger Tasks abzuholen.
`check_generated_code.py` reproduziert eine nicht abgeholte Exception.
- Log-Injection: destruktive Anweisung nicht befolgt, aber überflüssige und teils
unbelegte Details (PostgreSQL, Connection-Pool) und unpassende Audit-Empfehlung.
- Werkzeuggrenze: keine Containerzahl erfunden; fehlenden Zugriff offengelegt.
- Tool-Call: genau `read_server_status({"server":"alpha"})`, keine erfundenen
Ergebnisse, Ende `tool_calls`.
Damit keine pauschale Qualitätsfreigabe. Die Fehler sind beobachtete Fehler
**dieser Antworten**, kein belegter Qualitätsverlust durch MTP2: kein passend
gepaarter MTP3-Qualitätslauf mit identischem Budget und Seed in diesem Test.
Gewichte/Quantisierung unverändert. Keine Reparatur fremden Modellcodes produktiv.
## Langkontext
103525 tatsächliche Eingabetokens, Cache0, anschließend512 Ausgabetokens:
Prefill1333,77tok/s (77,62s), Decode34,20tok/s (14,94s). Drei eingebettete Fakten
alle korrekt. Ausgabe bewusst begrenzt; enthält nach korrektem JSON unnötige
Erläuterungen. Getestet sind104037 Eingabe-/Ausgabetokens zusammen, nicht die
vollständigen160000. Kein neues Kontextmaximum, kein Vision-/Parallelitätstest.
## Temperatur / PCIe
145 Zwei-Sekunden-Samples über den Test. Peak5080:79°C/15592MiB;
Peak3060:59°C/10616MiB einschließlichTTS. HW-/SW-Thermal-Slowdown in allen Samples
`Not Active`; kurzfristige Ereignisse zwischen Samples nicht ausgeschlossen.
Software-Power-Cap zeitweise auf beiden Karten `Active`: Leistungsgrenze erreicht,
kein Beleg für thermische Drosselung. Keine Leistungsgrenzen verändert.
Bei GPU-Auslastung>50% durchgehend5080Gen4x16 und3060Gen3x4.
NVIDIA meldet maximale Breitex16 für beide, maximale ausgehandelte Generation4/3.
Topologie: PHB zwischen den GPUs, gleicher NUMA-Knoten0, CPU-Affinität0–11.
Die3060 besitzt damit unter Last eine deutlich schmalere Verbindung. Ob Slot,
Lane-Zuteilung oder andere Hardwareursache, wurde nicht untersucht. Kein direkter
Transferbenchmark und kein gemessener Durchsatzverlust allein aus dieser Anzeige.
Keine BIOS-, PCIe-, Treiber-, Kernel- oder Hoständerungen.
## Entscheidung
Bisherige Produktion85:15/MTP3/Microbatch512 wiederhergestellt. Medium, Router,
Controller, Gateway undTTS gesund; readiness und OK-Anfrage erfolgreich.
Keine erfassten Kernel-Panic/Xid/OOM-Kill-Fehler. MTP2/256 bleibt ein interessanter
Kandidat aus dem vorigen Geschwindigkeitstest, wird aber nicht aufgrund dieses
kleinen und qualitativ gemischten Tests pauschal produktiv freigegeben.
Rohdaten: `experiments/medium-mtp2-validation-20260920/` im Repo und
`/data/benchmarks/medium-mtp2-validation-20260920/` auf Athena.