Document max-VRAM IQ3 speed tests

This commit is contained in:
Mikei386
2026-09-08 14:14:46 +02:00
parent 3e3fbbe9bd
commit 30fdbd4b7a
+33
View File
@@ -108,3 +108,36 @@ Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
Die vollständigen JSON-Ergebnisse liegen auf Athena unter Die vollständigen JSON-Ergebnisse liegen auf Athena unter
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`. `/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026
Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits.
Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren
reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter
echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060
geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und
ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.
| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 |
|---|---:|---:|---:|---:|---:|
| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % |
| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % |
| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % |
Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim
ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit
96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden
VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden,
stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten
Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch
die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche
KV-, MTP- und Compute-Puffer.
Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere
Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp
schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem
kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher
Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt
sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen.
Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und
tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.