52 lines
2.6 KiB
Markdown
52 lines
2.6 KiB
Markdown
# DFlash2: kurzer Medium-Test auf Athena
|
|
|
|
20.09.2026. **Ergebnis: Laden fehlgeschlagen, keine Durchsatzmessung möglich.**
|
|
|
|
Die vorhandene llama.cpp-Version unterstützt DFlash2 einschließlich Selector und
|
|
Convolution. Das offizielle Q4_K_M-Draft-Modell (1,14 GB) wurde heruntergeladen
|
|
und per SHA256 geprüft. Hauptmodell blieb das bisherige Qwen Pure IQ4_XS.
|
|
|
|
| Einstellung | Kurztest |
|
|
|---|---|
|
|
| Kontext / Slots | 160.000 gemeinsam / 2 |
|
|
| Hauptmodell GPUs | 5080:3060 = 80:20, Layer-Splitting |
|
|
| Draft | ausschließlich 5080, maximal 7 Draft-Tokens |
|
|
| KV / Microbatch | q4_0 für beide Modelle / 128 |
|
|
| Weitere Last | TTS auf 3060 blieb resident |
|
|
| Umfang | Text ohne Vision, keine parallelen Anfragen |
|
|
|
|
Abweichungen vom bisherigen Medium: 80:20 statt 85:15, Microbatch 128 statt 512,
|
|
DFlash2 statt MTP3, kein Vision-Projektor, kein RAM-Promptcache. Es wurde weder
|
|
eine vollständige Medium-Funktionsgleichheit noch Langkontextnutzung geprüft.
|
|
|
|
Beim Laden des Draft-Modells schlug `cudaMalloc` für **1079,61 MiB auf CUDA0**
|
|
fehl. Der Server beendete sich regulär mit einem Modellladefehler. Die geplanten
|
|
kurzen Deutsch-, Code- und Prefill-Aufgaben wurden nicht ausgeführt. Prefill,
|
|
Generierung und Antwortqualität sind für DFlash2 hier daher **unbekannt**.
|
|
|
|
Die nach dem Laden vorgesehene 512-MiB-Reserveprüfung wurde nicht erreicht.
|
|
Das belegt eine Grenze dieses konkreten Speicherlayouts, nicht die allgemeine
|
|
Untauglichkeit oder Geschwindigkeit von DFlash2. Kein Versuch mit weiter
|
|
reduzierter Reserve, keine Serie von Speichergrenztests.
|
|
|
|
## Lohnt ein weiterer Test?
|
|
|
|
Als direkter Ersatz im getesteten Medium-Layout passt DFlash2 nicht. Ein weiterer
|
|
gezielter Versuch wäre nur mit angepasster Speicherverteilung sinnvoll: mehr
|
|
Hauptmodellschichten auf die 3060, Draft auf anderes Gerät, oder weniger
|
|
Slots/Kontext. Ob eine solche Variante schneller wäre, ist noch offen.
|
|
Für eine Geschwindigkeitsaussage liegen keinerlei DFlash2-Messwerte vor.
|
|
|
|
Der Supervisor hat die bisherigen Container unverändert wieder gestartet.
|
|
Medium, Router, Controller, Gateway und TTS sind gesund. Router readiness und
|
|
minimale Modellantwort geprüft; keine Xid-, Kernel-Panic-, OOM-Kill- oder
|
|
GPU-fallen-off-Meldung im geprüften Kerneljournal seit Testbeginn. Kein Reboot,
|
|
keine Treiber-, Kernel- oder Netzwerkänderung. Die Qwen-Benchmarkreferenz wurde
|
|
nicht erneut gemessen.
|
|
|
|
Rohdaten, Konfiguration, Testskripte und Wiederherstellungsnachweis liegen im
|
|
Repository unter `experiments/dflash2-medium-20260920/` und auf Athena unter
|
|
`/data/benchmarks/dflash2-medium-20260920/`.
|
|
|
|
Quelle des Draft-Modells: [IncoAI DFlash2 GGUF](https://huggingface.co/incoai/Qwen3.8-27B-DFlash2-GGUF).
|