# DFlash2: kurzer Medium-Test auf Athena Nachtrag: [Ein-Slot-Folgeversuch mit Draft auf 3060 funktioniert](DFLASH2_ONE_SLOT_20260920.md). Der folgende Abschnitt dokumentiert den ursprünglichen Zwei-Slot-Test. 20.09.2026. **Ergebnis: Laden fehlgeschlagen, keine Durchsatzmessung möglich.** Die vorhandene llama.cpp-Version unterstützt DFlash2 einschließlich Selector und Convolution. Das offizielle Q4_K_M-Draft-Modell (1,14 GB) wurde heruntergeladen und per SHA256 geprüft. Hauptmodell blieb das bisherige Qwen Pure IQ4_XS. | Einstellung | Kurztest | |---|---| | Kontext / Slots | 160.000 gemeinsam / 2 | | Hauptmodell GPUs | 5080:3060 = 80:20, Layer-Splitting | | Draft | ausschließlich 5080, maximal 7 Draft-Tokens | | KV / Microbatch | q4_0 für beide Modelle / 128 | | Weitere Last | TTS auf 3060 blieb resident | | Umfang | Text ohne Vision, keine parallelen Anfragen | Abweichungen vom bisherigen Medium: 80:20 statt 85:15, Microbatch 128 statt 512, DFlash2 statt MTP3, kein Vision-Projektor, kein RAM-Promptcache. Es wurde weder eine vollständige Medium-Funktionsgleichheit noch Langkontextnutzung geprüft. Beim Laden des Draft-Modells schlug `cudaMalloc` für **1079,61 MiB auf CUDA0** fehl. Der Server beendete sich regulär mit einem Modellladefehler. Die geplanten kurzen Deutsch-, Code- und Prefill-Aufgaben wurden nicht ausgeführt. Prefill, Generierung und Antwortqualität sind für DFlash2 hier daher **unbekannt**. Die nach dem Laden vorgesehene 512-MiB-Reserveprüfung wurde nicht erreicht. Das belegt eine Grenze dieses konkreten Speicherlayouts, nicht die allgemeine Untauglichkeit oder Geschwindigkeit von DFlash2. Kein Versuch mit weiter reduzierter Reserve, keine Serie von Speichergrenztests. ## Lohnt ein weiterer Test? Als direkter Ersatz im getesteten Medium-Layout passt DFlash2 nicht. Ein weiterer gezielter Versuch wäre nur mit angepasster Speicherverteilung sinnvoll: mehr Hauptmodellschichten auf die 3060, Draft auf anderes Gerät, oder weniger Slots/Kontext. Ob eine solche Variante schneller wäre, ist noch offen. Für eine Geschwindigkeitsaussage liegen keinerlei DFlash2-Messwerte vor. Der Supervisor hat die bisherigen Container unverändert wieder gestartet. Medium, Router, Controller, Gateway und TTS sind gesund. Router readiness und minimale Modellantwort geprüft; keine Xid-, Kernel-Panic-, OOM-Kill- oder GPU-fallen-off-Meldung im geprüften Kerneljournal seit Testbeginn. Kein Reboot, keine Treiber-, Kernel- oder Netzwerkänderung. Die Qwen-Benchmarkreferenz wurde nicht erneut gemessen. Rohdaten, Konfiguration, Testskripte und Wiederherstellungsnachweis liegen im Repository unter `experiments/dflash2-medium-20260920/` und auf Athena unter `/data/benchmarks/dflash2-medium-20260920/`. Quelle des Draft-Modells: [IncoAI DFlash2 GGUF](https://huggingface.co/incoai/Qwen3.8-27B-DFlash2-GGUF).