Document max-VRAM IQ3 speed tests
This commit is contained in:
@@ -108,3 +108,36 @@ Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
|
||||
|
||||
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
|
||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
|
||||
|
||||
## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026
|
||||
|
||||
Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits.
|
||||
Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren
|
||||
reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter
|
||||
echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060
|
||||
geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und
|
||||
ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.
|
||||
|
||||
| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 |
|
||||
|---|---:|---:|---:|---:|---:|
|
||||
| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % |
|
||||
| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % |
|
||||
| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % |
|
||||
|
||||
Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim
|
||||
ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit
|
||||
96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden
|
||||
VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden,
|
||||
stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten
|
||||
Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch
|
||||
die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche
|
||||
KV-, MTP- und Compute-Puffer.
|
||||
|
||||
Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere
|
||||
Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp
|
||||
schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem
|
||||
kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher
|
||||
Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt
|
||||
sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen.
|
||||
Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und
|
||||
tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.
|
||||
|
||||
Reference in New Issue
Block a user