Files
AI-Profile-Router/docs/ATHENA_SESSION_20260920.md
T

7.1 KiB

Athena: Tests, Fehler, Änderungen und Abschluss am 20.09.2026

Verifizierte Produktion am Ende der Sitzung

Profil MTP Microbatch Kontext konfiguriert Slots Split 5080:3060 Status beim Abgleich
Fast 2 64 76800 1 nur5080, Vision3060 gestoppt
Medium 2 256 160000 gemeinsam 2 85:15 aktiv, gesund
Large 2 256 192000 1 86:14 neu angelegt, nächster Profilwechsel
Ultra 2 128 262144 1 80:20 gestoppt
Uncensored 2 256 80000 1 90:10 gestoppt

Keine Modellgewichte oder Quantisierungen ersetzt. Medium und Large verwenden weiterhin Pure IQ4_XS. Matrix/Compose-Defaults und tatsächliche Hostkonfiguration sind zu unterscheiden: Mediums zwei Slots kommen aus der lokalen Konfiguration; der portable Standard bleibt ein Slot. MEDIUM_UBATCH_SIZE=256 wurde auf Athena in /etc/mike-ai/stack.env gespeichert, ohne Secrets ins Git aufzunehmen. Sicherung davor: /etc/mike-ai/stack.env.before-medium-mtp2.

Test- und Änderungshistorie

Arbeit Ergebnis / Entscheidung Bericht / Rohdaten Commit
Router-Audit Controller-Polling reduziert, Wartezeiten für Chats begrenzt, Smoke-Proben Audit 6071b1a,82c5096
ByteShape gegen Pure/MIX Mehr Single-GPU-Kontext, kein allgemeiner Tempo-/Qualitätsgewinn; Modelle beibehalten Vergleich, feste Referenz 980f339
DFlash2 Medium Ursprüngliches Layout scheitert am Draft-VRAM Ersttest 3d59311
DFlash2 ein Slot Draft5080 Gerätefehler; Draft3060 funktioniert, Deutsch37,8/Code75,5tok/s ohne klaren Gesamtnutzen Folgetests 4007242
Effizienz / NVIDIA-NVFP4 Offizielle Gewichte20,42GiB; Kapazitätsprüfung, kein NVFP4-Inferenztest; Pipeline-Rückfall gefunden Audit 2425c99
Medium Microbatch512/256 256 lädt, anfangs Schutzabbruch bei461MiB frei unter512MiB Grenze Ersttest ba808e1
Reserve448 Freigegebener256-Kurztest bestanden;24K-Prefill+7,1%, kurze Decodes fast gleich Folgetest, experiments/medium-microbatch-20260920 c78a083
FLUX wiederholte Bilder FP8-Konverter und Speicherlebenszyklus korrigiert; zwei Bilder nacheinander erfolgreich,67,883s insgesamt Reparatur 3cbcf41
Split/MTP Vier Varianten;85:15/MTP2 bei256 interessant, Deutsch+10,3%, Code/24K etwa gleich,268MiB weniger Peak5080 Vergleich, experiments/medium-split-mtp-20260920 635b3c4
MTP2 Qualität/103K/Hardware Sechs vollständige Antworten, korrekter Tool-Call,103K-Recall3/3; konkrete Antwortfehler dokumentiert Validierung, experiments/medium-mtp2-validation-20260920 9e836cf
Andere Profile Fast/Ultra/Uncensored bereitsMTP2. Medium512/MTP2 Warmup-Abbruch. LargeMTP2 Kurztest erfolgreich und übernommen Profiltest, experiments/profile-mtp2-20260920 b352e29
Abschließende Medium-Übernahme Auf Nutzerwunsch getestete Kombination256/MTP2 produktiv; Start, OK-Antwort und Router-readiness bestanden Übernahmebeleg fbe8c6f

Die Kurztests sind keine breite Wiederholung der eingefrorenen Qwen-Referenz. Notwendige direkte Kontrollen für veränderte Laufzeitparameter sind separat archiviert. Originalreferenz unverändert, für künftige Modellvergleiche wiederverwenden.

Aussagekräftigste Messwerte und Grenzen

  • Medium MTP2/256: 103525 Eingabetokens ohne Cache;1333,77tok/s Prefill und34,20tok/s Decode für512 Ausgabetokens. Alle drei Fakten korrekt. Kein maximales160K-Fenster getestet.
  • Qualität: Logik und Migrationsbeweis korrekt. Code übersieht Exceptions anderer gleichzeitig fertiger Tasks; lokaler Gegenbeispieltest bestätigt dies. Diagnose schließt transiente Fehler zu stark aus. Keine bewiesene Verschlechterung durch MTP2, aber auch keine pauschale Qualitätsgleichheit. Vollständige Einzelantworten archiviert.
  • LargeMTP2 gegenüberMTP3: Deutsch61,36/59,67, Code77,84/77,18, Prefill2016,76/1964,41, Decode nach4196Tokens66,42/62,46tok/s. Je ein kurzer Lauf; Recall3/3 in beiden Armen.
  • Temperaturtest:5080max79°C,3060max59°C;145 Samples im Zwei-Sekunden-Abstand, keine aktive HW-/SW-Thermal-Drosselung beobachtet. Power-Cap zeitweise aktiv.
  • PCIe unter Last:5080Gen4x16,3060Gen3x4, PHB-Verbindung. Linkbreite ist kein direkter Nachweis der tatsächlich verlorenen Tokens/s. Keine Hardware-/BIOS-Änderung.
  • Keine volle160K-/192K-, Vision- oder Parallelitätsqualifikation der neuen Kombinationen. Antworttexte zwischen Varianten teils verschieden; kleine Unterschiede und Einzelmessungen nicht als allgemeines Tempo-Versprechen verstehen.
  • Reserve448MiB war eine Startprüfung für Experimente, keine NVIDIA-Speicherreservierung.

Abgeschnittene Antwort „Die“: Diagnose offen

Um22:29:22MESZ wurde ein Request mit214012Tokens bei160000Kontext abgewiesen. Um22:31:18 und22:31:38 endeten andere Requests technisch mitHTTP200 und2682 bzw851 Ausgabetokens; kein protokollierter Streamabbruch. MTP-Akzeptanz etwa84% bzw65%. Das belegt weder ein bestimmtes EOS-Token noch die Ursache der sichtbaren Kürzung. Niedrigere Akzeptanz allein löst kein Endtoken aus. Clientantwort/finish_reason fehlten; Unraid-SSH war nicht zugänglich. Keine vermeintliche Reparatur dafür behauptet oder umgesetzt. Die angezeigten11,3K Tokens konnten aus mehreren Aufrufen stammen; Zuordnung ohne Clientsitzungsdaten nicht abschließend bewiesen.

Betrieb, Rückfall und Git

Isolierte Testcontainer mit Ressourcen-/Temperaturgrenzen und Wiederherstellung verwendet. Erfolgreiche Abschlussprüfungen: Medium/Router/Controller gesund, ModellantwortOK, Router-readiness. Gateway undTTS blieben erhalten. Kein Hostreboot, keine Kernel-/Treiber-/Netzänderung. In den dokumentierten Prüfzeiträumen keine erfassten Kernel-Panic-,Xid- oderOOM-Kill-Ereignisse. Containerinterne CUDA-Fehler sind separat als fehlgeschlagene Versuche archiviert.

Bei Bedarf nur Medium auf MTP3/512 zurückstellen, vorher laufende Requests auslaufen lassen. Nicht ausschließlich MTP auf2 bei512 setzen: genau diese Kombination scheiterte. Alter Bildworker als mike-ai/image-worker:before-repeat-fix-20260920 vorhanden. Kein automatischer Rückbau funktionierender Änderungen.

Alle aufgeführten Commits wurden auf main nach https://git.casaderoll.de/michael/AI-Profile-Router gepusht und per Git-Bundle mit /opt/mike-ai/stack auf Athena synchronisiert. Bundles umgehen den dort nicht zuverlässig erreichbaren Git-SSH-Port; Quellstände wurden fast-forward übernommen. Secrets, Schlüssel, Nutzerchats und Modellgewichte sind nicht Teil dieser Ergänzung.

Offen: umfassende Kontext-/Vision-/Parallelitätsprüfung, vollständige DFlash2- Bewertung und ExLlamaV3/EXL3. Keine weiteren Tests automatisch gestartet/geplant.