Files
AI-Profile-Router/docs/DFLASH2_MEDIUM_QUICK_20260920.md

2.8 KiB

DFlash2: kurzer Medium-Test auf Athena

Nachtrag: Ein-Slot-Folgeversuch mit Draft auf 3060 funktioniert. Der folgende Abschnitt dokumentiert den ursprünglichen Zwei-Slot-Test.

20.09.2026. Ergebnis: Laden fehlgeschlagen, keine Durchsatzmessung möglich.

Die vorhandene llama.cpp-Version unterstützt DFlash2 einschließlich Selector und Convolution. Das offizielle Q4_K_M-Draft-Modell (1,14 GB) wurde heruntergeladen und per SHA256 geprüft. Hauptmodell blieb das bisherige Qwen Pure IQ4_XS.

Einstellung Kurztest
Kontext / Slots 160.000 gemeinsam / 2
Hauptmodell GPUs 5080:3060 = 80:20, Layer-Splitting
Draft ausschließlich 5080, maximal 7 Draft-Tokens
KV / Microbatch q4_0 für beide Modelle / 128
Weitere Last TTS auf 3060 blieb resident
Umfang Text ohne Vision, keine parallelen Anfragen

Abweichungen vom bisherigen Medium: 80:20 statt 85:15, Microbatch 128 statt 512, DFlash2 statt MTP3, kein Vision-Projektor, kein RAM-Promptcache. Es wurde weder eine vollständige Medium-Funktionsgleichheit noch Langkontextnutzung geprüft.

Beim Laden des Draft-Modells schlug cudaMalloc für 1079,61 MiB auf CUDA0 fehl. Der Server beendete sich regulär mit einem Modellladefehler. Die geplanten kurzen Deutsch-, Code- und Prefill-Aufgaben wurden nicht ausgeführt. Prefill, Generierung und Antwortqualität sind für DFlash2 hier daher unbekannt.

Die nach dem Laden vorgesehene 512-MiB-Reserveprüfung wurde nicht erreicht. Das belegt eine Grenze dieses konkreten Speicherlayouts, nicht die allgemeine Untauglichkeit oder Geschwindigkeit von DFlash2. Kein Versuch mit weiter reduzierter Reserve, keine Serie von Speichergrenztests.

Lohnt ein weiterer Test?

Als direkter Ersatz im getesteten Medium-Layout passt DFlash2 nicht. Ein weiterer gezielter Versuch wäre nur mit angepasster Speicherverteilung sinnvoll: mehr Hauptmodellschichten auf die 3060, Draft auf anderes Gerät, oder weniger Slots/Kontext. Ob eine solche Variante schneller wäre, ist noch offen. Für eine Geschwindigkeitsaussage liegen keinerlei DFlash2-Messwerte vor.

Der Supervisor hat die bisherigen Container unverändert wieder gestartet. Medium, Router, Controller, Gateway und TTS sind gesund. Router readiness und minimale Modellantwort geprüft; keine Xid-, Kernel-Panic-, OOM-Kill- oder GPU-fallen-off-Meldung im geprüften Kerneljournal seit Testbeginn. Kein Reboot, keine Treiber-, Kernel- oder Netzwerkänderung. Die Qwen-Benchmarkreferenz wurde nicht erneut gemessen.

Rohdaten, Konfiguration, Testskripte und Wiederherstellungsnachweis liegen im Repository unter experiments/dflash2-medium-20260920/ und auf Athena unter /data/benchmarks/dflash2-medium-20260920/.

Quelle des Draft-Modells: IncoAI DFlash2 GGUF.