From 30fdbd4b7a860326353ed0fb022303b5c86b6d86 Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Tue, 8 Sep 2026 14:14:46 +0200 Subject: [PATCH] Document max-VRAM IQ3 speed tests --- docs/GSQ_RCO_BETA1_20260904.md | 33 +++++++++++++++++++++++++++++++++ 1 file changed, 33 insertions(+) diff --git a/docs/GSQ_RCO_BETA1_20260904.md b/docs/GSQ_RCO_BETA1_20260904.md index e9824eb..a5595c3 100644 --- a/docs/GSQ_RCO_BETA1_20260904.md +++ b/docs/GSQ_RCO_BETA1_20260904.md @@ -108,3 +108,36 @@ Platzierungsvorteil gilt nicht automatisch für die größeren Profile. Die vollständigen JSON-Ergebnisse liegen auf Athena unter `/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`. + +## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026 + +Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits. +Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren +reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter +echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060 +geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und +ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen. + +| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 | +|---|---:|---:|---:|---:|---:| +| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % | +| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % | +| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % | + +Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim +ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit +96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden +VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden, +stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten +Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch +die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche +KV-, MTP- und Compute-Puffer. + +Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere +Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp +schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem +kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher +Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt +sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen. +Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und +tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.