Consolidate Athena test history and final MTP2 production state
This commit is contained in:
@@ -0,0 +1,92 @@
|
||||
# Athena: Tests, Fehler, Änderungen und Abschluss am 20.09.2026
|
||||
|
||||
## Verifizierte Produktion am Ende der Sitzung
|
||||
|
||||
| Profil | MTP | Microbatch | Kontext konfiguriert | Slots | Split 5080:3060 | Status beim Abgleich |
|
||||
|---|---:|---:|---:|---:|---|---|
|
||||
| Fast | 2 | 64 | 76800 | 1 | nur5080, Vision3060 | gestoppt |
|
||||
| Medium | **2** | **256** | 160000 gemeinsam | 2 | 85:15 | aktiv, gesund |
|
||||
| Large | **2** | 256 | 192000 | 1 | 86:14 | neu angelegt, nächster Profilwechsel |
|
||||
| Ultra | 2 | 128 | 262144 | 1 | 80:20 | gestoppt |
|
||||
| Uncensored | 2 | 256 | 80000 | 1 | 90:10 | gestoppt |
|
||||
|
||||
Keine Modellgewichte oder Quantisierungen ersetzt. Medium und Large verwenden
|
||||
weiterhin Pure IQ4_XS. Matrix/Compose-Defaults und tatsächliche Hostkonfiguration
|
||||
sind zu unterscheiden: Mediums zwei Slots kommen aus der lokalen Konfiguration;
|
||||
der portable Standard bleibt ein Slot. `MEDIUM_UBATCH_SIZE=256` wurde auf Athena
|
||||
in `/etc/mike-ai/stack.env` gespeichert, ohne Secrets ins Git aufzunehmen.
|
||||
Sicherung davor: `/etc/mike-ai/stack.env.before-medium-mtp2`.
|
||||
|
||||
## Test- und Änderungshistorie
|
||||
|
||||
| Arbeit | Ergebnis / Entscheidung | Bericht / Rohdaten | Commit |
|
||||
|---|---|---|---|
|
||||
| Router-Audit | Controller-Polling reduziert, Wartezeiten für Chats begrenzt, Smoke-Proben | [Audit](ROUTER_AUDIT_20260920.md) |6071b1a,82c5096|
|
||||
| ByteShape gegen Pure/MIX | Mehr Single-GPU-Kontext, kein allgemeiner Tempo-/Qualitätsgewinn; Modelle beibehalten | [Vergleich](QWEN38_BYTESHAPE_AB_20260920.md), [feste Referenz](../benchmarks/athena-qwen38-reference-20260920/README.md) |980f339|
|
||||
| DFlash2 Medium | Ursprüngliches Layout scheitert am Draft-VRAM | [Ersttest](DFLASH2_MEDIUM_QUICK_20260920.md) |3d59311|
|
||||
| DFlash2 ein Slot | Draft5080 Gerätefehler; Draft3060 funktioniert, Deutsch37,8/Code75,5tok/s ohne klaren Gesamtnutzen | [Folgetests](DFLASH2_ONE_SLOT_20260920.md) |4007242|
|
||||
| Effizienz / NVIDIA-NVFP4 | Offizielle Gewichte20,42GiB; Kapazitätsprüfung, kein NVFP4-Inferenztest; Pipeline-Rückfall gefunden | [Audit](ATHENA_EFFICIENCY_REVIEW_20260920.md) |2425c99|
|
||||
| Medium Microbatch512/256 | 256 lädt, anfangs Schutzabbruch bei461MiB frei unter512MiB Grenze | [Ersttest](MEDIUM_MICROBATCH_20260920.md) |ba808e1|
|
||||
| Reserve448 | Freigegebener256-Kurztest bestanden;24K-Prefill+7,1%, kurze Decodes fast gleich | [Folgetest](MEDIUM_MICROBATCH_RESERVE448_20260920.md), experiments/medium-microbatch-20260920 |c78a083|
|
||||
| FLUX wiederholte Bilder | FP8-Konverter und Speicherlebenszyklus korrigiert; zwei Bilder nacheinander erfolgreich,67,883s insgesamt | [Reparatur](FLUX_REPEAT_FIX_20260920.md) |3cbcf41|
|
||||
| Split/MTP | Vier Varianten;85:15/MTP2 bei256 interessant, Deutsch+10,3%, Code/24K etwa gleich,268MiB weniger Peak5080 | [Vergleich](MEDIUM_SPLIT_MTP_20260920.md), experiments/medium-split-mtp-20260920 |635b3c4|
|
||||
| MTP2 Qualität/103K/Hardware | Sechs vollständige Antworten, korrekter Tool-Call,103K-Recall3/3; konkrete Antwortfehler dokumentiert | [Validierung](MEDIUM_MTP2_VALIDATION_20260920.md), experiments/medium-mtp2-validation-20260920 |9e836cf|
|
||||
| Andere Profile | Fast/Ultra/Uncensored bereitsMTP2. Medium512/MTP2 Warmup-Abbruch. LargeMTP2 Kurztest erfolgreich und übernommen | [Profiltest](PROFILE_MTP2_ROLLOUT_20260920.md), experiments/profile-mtp2-20260920 |b352e29|
|
||||
| Abschließende Medium-Übernahme | Auf Nutzerwunsch getestete Kombination256/MTP2 produktiv; Start, OK-Antwort und Router-readiness bestanden | [Übernahmebeleg](../experiments/medium-mtp2-validation-20260920/production-adopted.json) |fbe8c6f|
|
||||
|
||||
Die Kurztests sind keine breite Wiederholung der eingefrorenen Qwen-Referenz.
|
||||
Notwendige direkte Kontrollen für veränderte Laufzeitparameter sind separat
|
||||
archiviert. Originalreferenz unverändert, für künftige Modellvergleiche wiederverwenden.
|
||||
|
||||
## Aussagekräftigste Messwerte und Grenzen
|
||||
|
||||
- Medium MTP2/256: 103525 Eingabetokens ohne Cache;1333,77tok/s Prefill und34,20tok/s
|
||||
Decode für512 Ausgabetokens. Alle drei Fakten korrekt. Kein maximales160K-Fenster getestet.
|
||||
- Qualität: Logik und Migrationsbeweis korrekt. Code übersieht Exceptions anderer
|
||||
gleichzeitig fertiger Tasks; lokaler Gegenbeispieltest bestätigt dies. Diagnose
|
||||
schließt transiente Fehler zu stark aus. Keine bewiesene Verschlechterung durch
|
||||
MTP2, aber auch keine pauschale Qualitätsgleichheit. Vollständige Einzelantworten archiviert.
|
||||
- LargeMTP2 gegenüberMTP3: Deutsch61,36/59,67, Code77,84/77,18, Prefill2016,76/1964,41,
|
||||
Decode nach4196Tokens66,42/62,46tok/s. Je ein kurzer Lauf; Recall3/3 in beiden Armen.
|
||||
- Temperaturtest:5080max79°C,3060max59°C;145 Samples im Zwei-Sekunden-Abstand,
|
||||
keine aktive HW-/SW-Thermal-Drosselung beobachtet. Power-Cap zeitweise aktiv.
|
||||
- PCIe unter Last:5080Gen4x16,3060Gen3x4, PHB-Verbindung. Linkbreite ist kein direkter
|
||||
Nachweis der tatsächlich verlorenen Tokens/s. Keine Hardware-/BIOS-Änderung.
|
||||
- Keine volle160K-/192K-, Vision- oder Parallelitätsqualifikation der neuen
|
||||
Kombinationen. Antworttexte zwischen Varianten teils verschieden; kleine
|
||||
Unterschiede und Einzelmessungen nicht als allgemeines Tempo-Versprechen verstehen.
|
||||
- Reserve448MiB war eine Startprüfung für Experimente, keine NVIDIA-Speicherreservierung.
|
||||
|
||||
## Abgeschnittene Antwort „Die“: Diagnose offen
|
||||
|
||||
Um22:29:22MESZ wurde ein Request mit214012Tokens bei160000Kontext abgewiesen.
|
||||
Um22:31:18 und22:31:38 endeten andere Requests technisch mitHTTP200 und2682 bzw851
|
||||
Ausgabetokens; kein protokollierter Streamabbruch. MTP-Akzeptanz etwa84% bzw65%.
|
||||
Das belegt weder ein bestimmtes EOS-Token noch die Ursache der sichtbaren Kürzung.
|
||||
Niedrigere Akzeptanz allein löst kein Endtoken aus. Clientantwort/finish_reason
|
||||
fehlten; Unraid-SSH war nicht zugänglich. Keine vermeintliche Reparatur dafür
|
||||
behauptet oder umgesetzt. Die angezeigten11,3K Tokens konnten aus mehreren
|
||||
Aufrufen stammen; Zuordnung ohne Clientsitzungsdaten nicht abschließend bewiesen.
|
||||
|
||||
## Betrieb, Rückfall und Git
|
||||
|
||||
Isolierte Testcontainer mit Ressourcen-/Temperaturgrenzen und Wiederherstellung
|
||||
verwendet. Erfolgreiche Abschlussprüfungen: Medium/Router/Controller gesund,
|
||||
ModellantwortOK, Router-readiness. Gateway undTTS blieben erhalten. Kein Hostreboot,
|
||||
keine Kernel-/Treiber-/Netzänderung. In den dokumentierten Prüfzeiträumen keine
|
||||
erfassten Kernel-Panic-,Xid- oderOOM-Kill-Ereignisse. Containerinterne CUDA-Fehler
|
||||
sind separat als fehlgeschlagene Versuche archiviert.
|
||||
|
||||
Bei Bedarf nur Medium auf MTP3/512 zurückstellen, vorher laufende Requests auslaufen
|
||||
lassen. Nicht ausschließlich MTP auf2 bei512 setzen: genau diese Kombination
|
||||
scheiterte. Alter Bildworker als `mike-ai/image-worker:before-repeat-fix-20260920`
|
||||
vorhanden. Kein automatischer Rückbau funktionierender Änderungen.
|
||||
|
||||
Alle aufgeführten Commits wurden auf `main` nach
|
||||
`https://git.casaderoll.de/michael/AI-Profile-Router` gepusht und per Git-Bundle
|
||||
mit `/opt/mike-ai/stack` auf Athena synchronisiert. Bundles umgehen den dort nicht
|
||||
zuverlässig erreichbaren Git-SSH-Port; Quellstände wurden fast-forward übernommen.
|
||||
Secrets, Schlüssel, Nutzerchats und Modellgewichte sind nicht Teil dieser Ergänzung.
|
||||
|
||||
Offen: umfassende Kontext-/Vision-/Parallelitätsprüfung, vollständige DFlash2-
|
||||
Bewertung und ExLlamaV3/EXL3. Keine weiteren Tests automatisch gestartet/geplant.
|
||||
@@ -2,8 +2,12 @@
|
||||
|
||||
Stand: 20. September 2026. Modellfamilie bleibt Qwen3.8-27B.
|
||||
|
||||
**Aktueller Abschluss:** Medium MTP2/256 und Large MTP2 übernommen.
|
||||
[Gesamthistorie und Grenzen](ATHENA_SESSION_20260920.md). Nachfolgende
|
||||
Testabschnitte dokumentieren auch frühere Zwischenstände.
|
||||
|
||||
- [x] **1. Abgeschlossen (Textvergleich):** ByteShape ShapeLearn GPU-5 (IQ4_XS, 3.84 bpw) mit MTP gegen Pure IQ4_XS vergleichen. Zuerst RTX 5080 allein, maximal praktisch nutzbaren Kontext bestimmen; danach beide GPUs mit Vorrang für die 5080. Qualität, kaltes Prefill, Generierung, Kontext und VRAM dokumentieren.
|
||||
- [ ] **2.** Beim besseren Kandidaten GPU-Verteilung und MTP-Parameter gezielt optimieren.
|
||||
- [x] **2. Kurztest und selektive Übernahme abgeschlossen:** Pure beibehalten; Medium85:15/MTP2/256, Large86:14/MTP2/256. Volle Kontext-/Vision-/Parallelitätsqualifikation bleibt offen.
|
||||
- [ ] **3.** DFlash2 als separates Textprofil vergleichen, falls Speicher und verifizierte Laufzeitunterstützung ausreichen.
|
||||
- [ ] **4.** ExLlamaV3/EXL3 als alternative Laufzeit bewerten, einschließlich Funktionsgleichheit und Integrationsaufwand.
|
||||
|
||||
|
||||
+12
-7
@@ -5,6 +5,9 @@ Compose-Dateien, Git-Inhalten, Images, Health-Endpunkten und Backup-Timern.
|
||||
Containerzustände sind Momentaufnahmen; der Controller darf Profile danach
|
||||
umschalten. Es wurde für diesen Abgleich kein Dienst neu gestartet.
|
||||
|
||||
Aktueller Abschluss: [Test- und Änderungsübersicht](ATHENA_SESSION_20260920.md).
|
||||
Die folgenden MTP-/Microbatch-Werte enthalten die abschließenden Übernahmen.
|
||||
|
||||
## Laufzeit und Profile
|
||||
|
||||
Athena: Debian 13, RTX 5080 (16 GB) und RTX 3060 (12 GB). Die fünf
|
||||
@@ -19,17 +22,17 @@ identisch.
|
||||
| Profil | Qwen3.8-27B-Variante | Kontext | Slots | Tensor-Split 5080:3060 | Vision-Projektor | MTP Draft | ubatch |
|
||||
|---|---|---:|---:|---|---|---:|---:|
|
||||
| Fast | IQ4-MIX | 76.800 | 1 | nur 5080 | 3060 | 2 | 64 |
|
||||
| Medium | IQ4_XS Pure | 160.000 gemeinsam | 2 | 85:15 | 3060 | 3 | 512 |
|
||||
| Large | IQ4_XS Pure | 192.000 | 1 | 86:14 | 3060 | 3 | 256 |
|
||||
| Medium | IQ4_XS Pure | 160.000 gemeinsam | 2 | 85:15 | 3060 | 2 | 256 |
|
||||
| Large | IQ4_XS Pure | 192.000 | 1 | 86:14 | 3060 | 2 | 256 |
|
||||
| Ultra | IQ4_XS Pure | 262.144 | 1 | 80:20 | keiner | 2 | 128 |
|
||||
| Uncensored | Abliterated Q4_K_M | 80.000 | 1 | 90:10 | 3060 | 2 | 256 |
|
||||
|
||||
Tensor-Splits sind Startparameter, keine gemessenen VRAM-Anteile. Der
|
||||
Vision-Projektor liegt bei den vier Vision-Profilen auf GPU 1 (3060).
|
||||
`beta1` steht in der Repository-Matrix, ist aber nicht installiert. Der
|
||||
Router bietet nur die fünf installierten Profile an. Beim Abgleich am
|
||||
20. September lief Medium seit rund 21 Stunden gesund mit zwei Slots; die vier
|
||||
anderen Textprofile waren planmäßig gestoppt. Dashboard, Router, Controller,
|
||||
Der Router bietet die fünf installierten Profile an. Beim abschließenden
|
||||
Abgleich am 20. September lief Medium gesund mit MTP2, Microbatch256 und zwei
|
||||
Slots. Large ist mit MTP2 neu angelegt und startet beim nächsten Profilwechsel;
|
||||
die anderen Profile sind planmäßig gestoppt. Dashboard, Router, Controller,
|
||||
Whisper, TTS und Realtime-Voice waren ebenfalls gesund. Der frühere
|
||||
Vision-/CLIP-Absturz ist als historischer Befund erhalten, beschreibt aber
|
||||
nicht mehr den aktuellen Containerzustand.
|
||||
@@ -68,7 +71,9 @@ Die Funktionsänderungen sind in Commit `6071b1a` enthalten; anschließende
|
||||
Dokumentationskorrekturen ändern keine Container. Die früheren Live-Anpassungen
|
||||
an Compose, Dashboard und Voice-Bridge wurden bytegenau verglichen und in einem
|
||||
lokalen Sicherungscommit erhalten. Controller und Router wurden gezielt ersetzt;
|
||||
Medium und Gateway behielten ihre ursprünglichen Startzeiten.
|
||||
Zum damaligen Router-Audit behielten Medium und Gateway ihre Startzeiten.
|
||||
Die späteren Modelltests und die Medium-Übernahme starteten Medium mehrfach neu;
|
||||
der Gateway blieb unverändert. Die späteren Commits sind in der Abschlussübersicht verzeichnet.
|
||||
Messwerte, Prüfungen und Rückfallstand stehen im
|
||||
[Router-Audit](ROUTER_AUDIT_20260920.md).
|
||||
|
||||
|
||||
@@ -1,5 +1,8 @@
|
||||
# Medium: Microbatch 512 gegen 256 — Kurztest
|
||||
|
||||
> Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large
|
||||
> auf MTP2 übernommen: [aktueller Abschluss](ATHENA_SESSION_20260920.md).
|
||||
|
||||
Nachtrag: [256 mit gesenkter Startreserve erfolgreich getestet](MEDIUM_MICROBATCH_RESERVE448_20260920.md). Der folgende Bericht dokumentiert den vorherigen Schutzabbruch.
|
||||
|
||||
20.09.2026. **256 lädt ohne den bisherigen Pufferfehler, hat aber zu wenig
|
||||
|
||||
@@ -1,5 +1,8 @@
|
||||
# Medium Microbatch 256: Kurztest mit reduzierter Reserve
|
||||
|
||||
> Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large
|
||||
> auf MTP2 übernommen: [aktueller Abschluss](ATHENA_SESSION_20260920.md).
|
||||
|
||||
20.09.2026. **Nach ausdrücklicher Freigabe wurde die Startreserve ausschließlich
|
||||
für diesen Test von 512 auf 448 MiB gesenkt. Microbatch 256 besteht die kurzen
|
||||
Inferenztests.** Die übrigen Schutzmaßnahmen blieben aktiv.
|
||||
|
||||
@@ -1,5 +1,8 @@
|
||||
# MTP2/85:15/Microbatch256: Qualität, Langkontext und Hardware
|
||||
|
||||
> Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large
|
||||
> auf MTP2 übernommen: [aktueller Abschluss](ATHENA_SESSION_20260920.md).
|
||||
|
||||
20.09.2026. Pure IQ4_XS, Kontext160000, zwei Slots, Vision geladen, TTS resident.
|
||||
Sechs ausgewählte Qualitätsaufgaben mit Reasoning medium, Seed42, Budget8192;
|
||||
ein Tool-Call und eine kalte Langkontextanfrage. Kein breiter neuer Baseline-Lauf.
|
||||
|
||||
@@ -1,5 +1,8 @@
|
||||
# Medium: GPU-Split und MTP – Kurzvergleich 20.09.2026
|
||||
|
||||
> Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large
|
||||
> auf MTP2 übernommen: [aktueller Abschluss](ATHENA_SESSION_20260920.md).
|
||||
|
||||
Vier isolierte Läufe mit Pure IQ4_XS, 160.000 konfigurierten Kontexttokens,
|
||||
zwei Slots, Vision geladen, TTS auf der 3060, Microbatch 256. Produktionsprofil
|
||||
nachher unverändert wiederhergestellt (85:15, MTP3, Microbatch512).
|
||||
|
||||
@@ -1,5 +1,8 @@
|
||||
# Selektive MTP2-Übernahme
|
||||
|
||||
> Historischer Teststand. Danach wurde Medium auf MTP2/Microbatch256 und Large
|
||||
> auf MTP2 übernommen: [aktueller Abschluss](ATHENA_SESSION_20260920.md).
|
||||
|
||||
20.09.2026. Fast, Ultra und Uncensored verwenden bereits MTP2 (Containerargumente
|
||||
geprüft, nicht neu gebenchmarkt). Medium und Large verwenden vorher MTP3.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user