Record bounded Medium DFlash2 feasibility test and VRAM limit
This commit is contained in:
@@ -0,0 +1,51 @@
|
||||
# DFlash2: kurzer Medium-Test auf Athena
|
||||
|
||||
20.09.2026. **Ergebnis: Laden fehlgeschlagen, keine Durchsatzmessung möglich.**
|
||||
|
||||
Die vorhandene llama.cpp-Version unterstützt DFlash2 einschließlich Selector und
|
||||
Convolution. Das offizielle Q4_K_M-Draft-Modell (1,14 GB) wurde heruntergeladen
|
||||
und per SHA256 geprüft. Hauptmodell blieb das bisherige Qwen Pure IQ4_XS.
|
||||
|
||||
| Einstellung | Kurztest |
|
||||
|---|---|
|
||||
| Kontext / Slots | 160.000 gemeinsam / 2 |
|
||||
| Hauptmodell GPUs | 5080:3060 = 80:20, Layer-Splitting |
|
||||
| Draft | ausschließlich 5080, maximal 7 Draft-Tokens |
|
||||
| KV / Microbatch | q4_0 für beide Modelle / 128 |
|
||||
| Weitere Last | TTS auf 3060 blieb resident |
|
||||
| Umfang | Text ohne Vision, keine parallelen Anfragen |
|
||||
|
||||
Abweichungen vom bisherigen Medium: 80:20 statt 85:15, Microbatch 128 statt 512,
|
||||
DFlash2 statt MTP3, kein Vision-Projektor, kein RAM-Promptcache. Es wurde weder
|
||||
eine vollständige Medium-Funktionsgleichheit noch Langkontextnutzung geprüft.
|
||||
|
||||
Beim Laden des Draft-Modells schlug `cudaMalloc` für **1079,61 MiB auf CUDA0**
|
||||
fehl. Der Server beendete sich regulär mit einem Modellladefehler. Die geplanten
|
||||
kurzen Deutsch-, Code- und Prefill-Aufgaben wurden nicht ausgeführt. Prefill,
|
||||
Generierung und Antwortqualität sind für DFlash2 hier daher **unbekannt**.
|
||||
|
||||
Die nach dem Laden vorgesehene 512-MiB-Reserveprüfung wurde nicht erreicht.
|
||||
Das belegt eine Grenze dieses konkreten Speicherlayouts, nicht die allgemeine
|
||||
Untauglichkeit oder Geschwindigkeit von DFlash2. Kein Versuch mit weiter
|
||||
reduzierter Reserve, keine Serie von Speichergrenztests.
|
||||
|
||||
## Lohnt ein weiterer Test?
|
||||
|
||||
Als direkter Ersatz im getesteten Medium-Layout passt DFlash2 nicht. Ein weiterer
|
||||
gezielter Versuch wäre nur mit angepasster Speicherverteilung sinnvoll: mehr
|
||||
Hauptmodellschichten auf die 3060, Draft auf anderes Gerät, oder weniger
|
||||
Slots/Kontext. Ob eine solche Variante schneller wäre, ist noch offen.
|
||||
Für eine Geschwindigkeitsaussage liegen keinerlei DFlash2-Messwerte vor.
|
||||
|
||||
Der Supervisor hat die bisherigen Container unverändert wieder gestartet.
|
||||
Medium, Router, Controller, Gateway und TTS sind gesund. Router readiness und
|
||||
minimale Modellantwort geprüft; keine Xid-, Kernel-Panic-, OOM-Kill- oder
|
||||
GPU-fallen-off-Meldung im geprüften Kerneljournal seit Testbeginn. Kein Reboot,
|
||||
keine Treiber-, Kernel- oder Netzwerkänderung. Die Qwen-Benchmarkreferenz wurde
|
||||
nicht erneut gemessen.
|
||||
|
||||
Rohdaten, Konfiguration, Testskripte und Wiederherstellungsnachweis liegen im
|
||||
Repository unter `experiments/dflash2-medium-20260920/` und auf Athena unter
|
||||
`/data/benchmarks/dflash2-medium-20260920/`.
|
||||
|
||||
Quelle des Draft-Modells: [IncoAI DFlash2 GGUF](https://huggingface.co/incoai/Qwen3.8-27B-DFlash2-GGUF).
|
||||
Reference in New Issue
Block a user