Files
AI-Profile-Router/docs/DFLASH2_MEDIUM_QUICK_20260920.md
T

52 lines
2.6 KiB
Markdown

# DFlash2: kurzer Medium-Test auf Athena
20.09.2026. **Ergebnis: Laden fehlgeschlagen, keine Durchsatzmessung möglich.**
Die vorhandene llama.cpp-Version unterstützt DFlash2 einschließlich Selector und
Convolution. Das offizielle Q4_K_M-Draft-Modell (1,14 GB) wurde heruntergeladen
und per SHA256 geprüft. Hauptmodell blieb das bisherige Qwen Pure IQ4_XS.
| Einstellung | Kurztest |
|---|---|
| Kontext / Slots | 160.000 gemeinsam / 2 |
| Hauptmodell GPUs | 5080:3060 = 80:20, Layer-Splitting |
| Draft | ausschließlich 5080, maximal 7 Draft-Tokens |
| KV / Microbatch | q4_0 für beide Modelle / 128 |
| Weitere Last | TTS auf 3060 blieb resident |
| Umfang | Text ohne Vision, keine parallelen Anfragen |
Abweichungen vom bisherigen Medium: 80:20 statt 85:15, Microbatch 128 statt 512,
DFlash2 statt MTP3, kein Vision-Projektor, kein RAM-Promptcache. Es wurde weder
eine vollständige Medium-Funktionsgleichheit noch Langkontextnutzung geprüft.
Beim Laden des Draft-Modells schlug `cudaMalloc` für **1079,61 MiB auf CUDA0**
fehl. Der Server beendete sich regulär mit einem Modellladefehler. Die geplanten
kurzen Deutsch-, Code- und Prefill-Aufgaben wurden nicht ausgeführt. Prefill,
Generierung und Antwortqualität sind für DFlash2 hier daher **unbekannt**.
Die nach dem Laden vorgesehene 512-MiB-Reserveprüfung wurde nicht erreicht.
Das belegt eine Grenze dieses konkreten Speicherlayouts, nicht die allgemeine
Untauglichkeit oder Geschwindigkeit von DFlash2. Kein Versuch mit weiter
reduzierter Reserve, keine Serie von Speichergrenztests.
## Lohnt ein weiterer Test?
Als direkter Ersatz im getesteten Medium-Layout passt DFlash2 nicht. Ein weiterer
gezielter Versuch wäre nur mit angepasster Speicherverteilung sinnvoll: mehr
Hauptmodellschichten auf die 3060, Draft auf anderes Gerät, oder weniger
Slots/Kontext. Ob eine solche Variante schneller wäre, ist noch offen.
Für eine Geschwindigkeitsaussage liegen keinerlei DFlash2-Messwerte vor.
Der Supervisor hat die bisherigen Container unverändert wieder gestartet.
Medium, Router, Controller, Gateway und TTS sind gesund. Router readiness und
minimale Modellantwort geprüft; keine Xid-, Kernel-Panic-, OOM-Kill- oder
GPU-fallen-off-Meldung im geprüften Kerneljournal seit Testbeginn. Kein Reboot,
keine Treiber-, Kernel- oder Netzwerkänderung. Die Qwen-Benchmarkreferenz wurde
nicht erneut gemessen.
Rohdaten, Konfiguration, Testskripte und Wiederherstellungsnachweis liegen im
Repository unter `experiments/dflash2-medium-20260920/` und auf Athena unter
`/data/benchmarks/dflash2-medium-20260920/`.
Quelle des Draft-Modells: [IncoAI DFlash2 GGUF](https://huggingface.co/incoai/Qwen3.8-27B-DFlash2-GGUF).