Document max-VRAM IQ3 speed tests
This commit is contained in:
@@ -108,3 +108,36 @@ Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
|
|||||||
|
|
||||||
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
|
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
|
||||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
|
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
|
||||||
|
|
||||||
|
## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026
|
||||||
|
|
||||||
|
Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits.
|
||||||
|
Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren
|
||||||
|
reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter
|
||||||
|
echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060
|
||||||
|
geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und
|
||||||
|
ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.
|
||||||
|
|
||||||
|
| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 |
|
||||||
|
|---|---:|---:|---:|---:|---:|
|
||||||
|
| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % |
|
||||||
|
| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % |
|
||||||
|
| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % |
|
||||||
|
|
||||||
|
Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim
|
||||||
|
ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit
|
||||||
|
96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden
|
||||||
|
VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden,
|
||||||
|
stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten
|
||||||
|
Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch
|
||||||
|
die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche
|
||||||
|
KV-, MTP- und Compute-Puffer.
|
||||||
|
|
||||||
|
Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere
|
||||||
|
Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp
|
||||||
|
schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem
|
||||||
|
kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher
|
||||||
|
Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt
|
||||||
|
sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen.
|
||||||
|
Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und
|
||||||
|
tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.
|
||||||
|
|||||||
Reference in New Issue
Block a user