2.6 KiB
DFlash2: kurzer Medium-Test auf Athena
20.09.2026. Ergebnis: Laden fehlgeschlagen, keine Durchsatzmessung möglich.
Die vorhandene llama.cpp-Version unterstützt DFlash2 einschließlich Selector und Convolution. Das offizielle Q4_K_M-Draft-Modell (1,14 GB) wurde heruntergeladen und per SHA256 geprüft. Hauptmodell blieb das bisherige Qwen Pure IQ4_XS.
| Einstellung | Kurztest |
|---|---|
| Kontext / Slots | 160.000 gemeinsam / 2 |
| Hauptmodell GPUs | 5080:3060 = 80:20, Layer-Splitting |
| Draft | ausschließlich 5080, maximal 7 Draft-Tokens |
| KV / Microbatch | q4_0 für beide Modelle / 128 |
| Weitere Last | TTS auf 3060 blieb resident |
| Umfang | Text ohne Vision, keine parallelen Anfragen |
Abweichungen vom bisherigen Medium: 80:20 statt 85:15, Microbatch 128 statt 512, DFlash2 statt MTP3, kein Vision-Projektor, kein RAM-Promptcache. Es wurde weder eine vollständige Medium-Funktionsgleichheit noch Langkontextnutzung geprüft.
Beim Laden des Draft-Modells schlug cudaMalloc für 1079,61 MiB auf CUDA0
fehl. Der Server beendete sich regulär mit einem Modellladefehler. Die geplanten
kurzen Deutsch-, Code- und Prefill-Aufgaben wurden nicht ausgeführt. Prefill,
Generierung und Antwortqualität sind für DFlash2 hier daher unbekannt.
Die nach dem Laden vorgesehene 512-MiB-Reserveprüfung wurde nicht erreicht. Das belegt eine Grenze dieses konkreten Speicherlayouts, nicht die allgemeine Untauglichkeit oder Geschwindigkeit von DFlash2. Kein Versuch mit weiter reduzierter Reserve, keine Serie von Speichergrenztests.
Lohnt ein weiterer Test?
Als direkter Ersatz im getesteten Medium-Layout passt DFlash2 nicht. Ein weiterer gezielter Versuch wäre nur mit angepasster Speicherverteilung sinnvoll: mehr Hauptmodellschichten auf die 3060, Draft auf anderes Gerät, oder weniger Slots/Kontext. Ob eine solche Variante schneller wäre, ist noch offen. Für eine Geschwindigkeitsaussage liegen keinerlei DFlash2-Messwerte vor.
Der Supervisor hat die bisherigen Container unverändert wieder gestartet. Medium, Router, Controller, Gateway und TTS sind gesund. Router readiness und minimale Modellantwort geprüft; keine Xid-, Kernel-Panic-, OOM-Kill- oder GPU-fallen-off-Meldung im geprüften Kerneljournal seit Testbeginn. Kein Reboot, keine Treiber-, Kernel- oder Netzwerkänderung. Die Qwen-Benchmarkreferenz wurde nicht erneut gemessen.
Rohdaten, Konfiguration, Testskripte und Wiederherstellungsnachweis liegen im
Repository unter experiments/dflash2-medium-20260920/ und auf Athena unter
/data/benchmarks/dflash2-medium-20260920/.
Quelle des Draft-Modells: IncoAI DFlash2 GGUF.