Upgrade Beta 1 to GSQ-RCO IQ3_S

This commit is contained in:
Mikei386 committed 2026-09-08 11:46:52 +02:00
1 parent 5746ac0e2c
commit f7ff14a1ce
7 files changed
+31 -21

No files matched your search

+15 -6
View File
@@ -5,15 +5,15 @@ Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unveränder
## Laufzeitkonfiguration
- Modell: Qwen3.8-27B GSQ-RCO IQ3_XXS MTP
- Kontext: 192.000 Token
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
- Kontext: 112.000 Token als konservativer Startwert
- Textmodell und KV-Cache: vollständig RTX 5080
- Vision-Projektor: RTX 3060
- KV-Quantisierung: Q4_0 für K und V
- MTP: 3 Draft-Token
- Batch / Micro-Batch: 2048 / 128
## Gemessene Kontextgrenze
## Vorherige IQ3_XXS-Kontextgrenze
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
VRAM-Grenze verwendet.
@@ -24,9 +24,18 @@ VRAM-Grenze verwendet.
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
Der produktive Beta-Modus verwendet deshalb 192.000 Token. 196.608 ist nur
die gemessene technische Obergrenze und besitzt keine ausreichende Reserve
für einen verlässlichen Dauerbetrieb.
Diese Werte gelten ausschließlich für die frühere, kleinere
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
## Austausch am 08.09.2026
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.