# Athena: Tests, Fehler, Änderungen und Abschluss am 20.09.2026 ## Verifizierte Produktion am Ende der Sitzung | Profil | MTP | Microbatch | Kontext konfiguriert | Slots | Split 5080:3060 | Status beim Abgleich | |---|---:|---:|---:|---:|---|---| | Fast | 2 | 64 | 76800 | 1 | nur5080, Vision3060 | gestoppt | | Medium | **2** | **256** | 160000 gemeinsam | 2 | 85:15 | aktiv, gesund | | Large | **2** | 256 | 192000 | 1 | 86:14 | neu angelegt, nächster Profilwechsel | | Ultra | 2 | 128 | 262144 | 1 | 80:20 | gestoppt | | Uncensored | 2 | 256 | 80000 | 1 | 90:10 | gestoppt | Keine Modellgewichte oder Quantisierungen ersetzt. Medium und Large verwenden weiterhin Pure IQ4_XS. Matrix/Compose-Defaults und tatsächliche Hostkonfiguration sind zu unterscheiden: Mediums zwei Slots kommen aus der lokalen Konfiguration; der portable Standard bleibt ein Slot. `MEDIUM_UBATCH_SIZE=256` wurde auf Athena in `/etc/mike-ai/stack.env` gespeichert, ohne Secrets ins Git aufzunehmen. Sicherung davor: `/etc/mike-ai/stack.env.before-medium-mtp2`. ## Test- und Änderungshistorie | Arbeit | Ergebnis / Entscheidung | Bericht / Rohdaten | Commit | |---|---|---|---| | Router-Audit | Controller-Polling reduziert, Wartezeiten für Chats begrenzt, Smoke-Proben | [Audit](ROUTER_AUDIT_20260920.md) |6071b1a,82c5096| | ByteShape gegen Pure/MIX | Mehr Single-GPU-Kontext, kein allgemeiner Tempo-/Qualitätsgewinn; Modelle beibehalten | [Vergleich](QWEN38_BYTESHAPE_AB_20260920.md), [feste Referenz](../benchmarks/athena-qwen38-reference-20260920/README.md) |980f339| | DFlash2 Medium | Ursprüngliches Layout scheitert am Draft-VRAM | [Ersttest](DFLASH2_MEDIUM_QUICK_20260920.md) |3d59311| | DFlash2 ein Slot | Draft5080 Gerätefehler; Draft3060 funktioniert, Deutsch37,8/Code75,5tok/s ohne klaren Gesamtnutzen | [Folgetests](DFLASH2_ONE_SLOT_20260920.md) |4007242| | Effizienz / NVIDIA-NVFP4 | Offizielle Gewichte20,42GiB; Kapazitätsprüfung, kein NVFP4-Inferenztest; Pipeline-Rückfall gefunden | [Audit](ATHENA_EFFICIENCY_REVIEW_20260920.md) |2425c99| | Medium Microbatch512/256 | 256 lädt, anfangs Schutzabbruch bei461MiB frei unter512MiB Grenze | [Ersttest](MEDIUM_MICROBATCH_20260920.md) |ba808e1| | Reserve448 | Freigegebener256-Kurztest bestanden;24K-Prefill+7,1%, kurze Decodes fast gleich | [Folgetest](MEDIUM_MICROBATCH_RESERVE448_20260920.md), experiments/medium-microbatch-20260920 |c78a083| | FLUX wiederholte Bilder | FP8-Konverter und Speicherlebenszyklus korrigiert; zwei Bilder nacheinander erfolgreich,67,883s insgesamt | [Reparatur](FLUX_REPEAT_FIX_20260920.md) |3cbcf41| | Split/MTP | Vier Varianten;85:15/MTP2 bei256 interessant, Deutsch+10,3%, Code/24K etwa gleich,268MiB weniger Peak5080 | [Vergleich](MEDIUM_SPLIT_MTP_20260920.md), experiments/medium-split-mtp-20260920 |635b3c4| | MTP2 Qualität/103K/Hardware | Sechs vollständige Antworten, korrekter Tool-Call,103K-Recall3/3; konkrete Antwortfehler dokumentiert | [Validierung](MEDIUM_MTP2_VALIDATION_20260920.md), experiments/medium-mtp2-validation-20260920 |9e836cf| | Andere Profile | Fast/Ultra/Uncensored bereitsMTP2. Medium512/MTP2 Warmup-Abbruch. LargeMTP2 Kurztest erfolgreich und übernommen | [Profiltest](PROFILE_MTP2_ROLLOUT_20260920.md), experiments/profile-mtp2-20260920 |b352e29| | Abschließende Medium-Übernahme | Auf Nutzerwunsch getestete Kombination256/MTP2 produktiv; Start, OK-Antwort und Router-readiness bestanden | [Übernahmebeleg](../experiments/medium-mtp2-validation-20260920/production-adopted.json) |fbe8c6f| Die Kurztests sind keine breite Wiederholung der eingefrorenen Qwen-Referenz. Notwendige direkte Kontrollen für veränderte Laufzeitparameter sind separat archiviert. Originalreferenz unverändert, für künftige Modellvergleiche wiederverwenden. ## Aussagekräftigste Messwerte und Grenzen - Medium MTP2/256: 103525 Eingabetokens ohne Cache;1333,77tok/s Prefill und34,20tok/s Decode für512 Ausgabetokens. Alle drei Fakten korrekt. Kein maximales160K-Fenster getestet. - Qualität: Logik und Migrationsbeweis korrekt. Code übersieht Exceptions anderer gleichzeitig fertiger Tasks; lokaler Gegenbeispieltest bestätigt dies. Diagnose schließt transiente Fehler zu stark aus. Keine bewiesene Verschlechterung durch MTP2, aber auch keine pauschale Qualitätsgleichheit. Vollständige Einzelantworten archiviert. - LargeMTP2 gegenüberMTP3: Deutsch61,36/59,67, Code77,84/77,18, Prefill2016,76/1964,41, Decode nach4196Tokens66,42/62,46tok/s. Je ein kurzer Lauf; Recall3/3 in beiden Armen. - Temperaturtest:5080max79°C,3060max59°C;145 Samples im Zwei-Sekunden-Abstand, keine aktive HW-/SW-Thermal-Drosselung beobachtet. Power-Cap zeitweise aktiv. - PCIe unter Last:5080Gen4x16,3060Gen3x4, PHB-Verbindung. Linkbreite ist kein direkter Nachweis der tatsächlich verlorenen Tokens/s. Keine Hardware-/BIOS-Änderung. - Keine volle160K-/192K-, Vision- oder Parallelitätsqualifikation der neuen Kombinationen. Antworttexte zwischen Varianten teils verschieden; kleine Unterschiede und Einzelmessungen nicht als allgemeines Tempo-Versprechen verstehen. - Reserve448MiB war eine Startprüfung für Experimente, keine NVIDIA-Speicherreservierung. ## Abgeschnittene Antwort „Die“: Diagnose offen Um22:29:22MESZ wurde ein Request mit214012Tokens bei160000Kontext abgewiesen. Um22:31:18 und22:31:38 endeten andere Requests technisch mitHTTP200 und2682 bzw851 Ausgabetokens; kein protokollierter Streamabbruch. MTP-Akzeptanz etwa84% bzw65%. Das belegt weder ein bestimmtes EOS-Token noch die Ursache der sichtbaren Kürzung. Niedrigere Akzeptanz allein löst kein Endtoken aus. Clientantwort/finish_reason fehlten; Unraid-SSH war nicht zugänglich. Keine vermeintliche Reparatur dafür behauptet oder umgesetzt. Die angezeigten11,3K Tokens konnten aus mehreren Aufrufen stammen; Zuordnung ohne Clientsitzungsdaten nicht abschließend bewiesen. ## Betrieb, Rückfall und Git Isolierte Testcontainer mit Ressourcen-/Temperaturgrenzen und Wiederherstellung verwendet. Erfolgreiche Abschlussprüfungen: Medium/Router/Controller gesund, ModellantwortOK, Router-readiness. Gateway undTTS blieben erhalten. Kein Hostreboot, keine Kernel-/Treiber-/Netzänderung. In den dokumentierten Prüfzeiträumen keine erfassten Kernel-Panic-,Xid- oderOOM-Kill-Ereignisse. Containerinterne CUDA-Fehler sind separat als fehlgeschlagene Versuche archiviert. Bei Bedarf nur Medium auf MTP3/512 zurückstellen, vorher laufende Requests auslaufen lassen. Nicht ausschließlich MTP auf2 bei512 setzen: genau diese Kombination scheiterte. Alter Bildworker als `mike-ai/image-worker:before-repeat-fix-20260920` vorhanden. Kein automatischer Rückbau funktionierender Änderungen. Alle aufgeführten Commits wurden auf `main` nach `https://git.casaderoll.de/michael/AI-Profile-Router` gepusht und per Git-Bundle mit `/opt/mike-ai/stack` auf Athena synchronisiert. Bundles umgehen den dort nicht zuverlässig erreichbaren Git-SSH-Port; Quellstände wurden fast-forward übernommen. Secrets, Schlüssel, Nutzerchats und Modellgewichte sind nicht Teil dieser Ergänzung. Offen: umfassende Kontext-/Vision-/Parallelitätsprüfung, vollständige DFlash2- Bewertung und ExLlamaV3/EXL3. Keine weiteren Tests automatisch gestartet/geplant.