Upgrade Beta 1 to GSQ-RCO IQ3_S
This commit is contained in:
@@ -5,15 +5,15 @@ Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unveränder
|
||||
|
||||
## Laufzeitkonfiguration
|
||||
|
||||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_XXS MTP
|
||||
- Kontext: 192.000 Token
|
||||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
|
||||
- Kontext: 112.000 Token als konservativer Startwert
|
||||
- Textmodell und KV-Cache: vollständig RTX 5080
|
||||
- Vision-Projektor: RTX 3060
|
||||
- KV-Quantisierung: Q4_0 für K und V
|
||||
- MTP: 3 Draft-Token
|
||||
- Batch / Micro-Batch: 2048 / 128
|
||||
|
||||
## Gemessene Kontextgrenze
|
||||
## Vorherige IQ3_XXS-Kontextgrenze
|
||||
|
||||
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
||||
VRAM-Grenze verwendet.
|
||||
@@ -24,9 +24,18 @@ VRAM-Grenze verwendet.
|
||||
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
||||
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
||||
|
||||
Der produktive Beta-Modus verwendet deshalb 192.000 Token. 196.608 ist nur
|
||||
die gemessene technische Obergrenze und besitzt keine ausreichende Reserve
|
||||
für einen verlässlichen Dauerbetrieb.
|
||||
Diese Werte gelten ausschließlich für die frühere, kleinere
|
||||
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
|
||||
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
|
||||
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
|
||||
|
||||
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
||||
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|
||||
|
||||
## Austausch am 08.09.2026
|
||||
|
||||
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
|
||||
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
|
||||
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
|
||||
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
|
||||
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
|
||||
|
||||
@@ -8,7 +8,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
||||
|---|---|---:|---:|---|---|---|---:|
|
||||
| fast | `qwen-fast` | 76,800 | 1 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
|
||||
| medium | `qwen-medium` | 160,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 85:15 | ja | 3 |
|
||||
| beta1 | `qwen-beta-1` | 192,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_XXS MTP | 5080 model / 3060 vision | ja | 3 |
|
||||
| beta1 | `qwen-beta-1` | 112,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_S MTP | 5080 model / 3060 vision | ja | 3 |
|
||||
| large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
|
||||
| ultra | `qwen-ultra` | 262,144 | 1 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
|
||||
| uncensored | `qwen-uncensored` | 80,000 | 1 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |
|
||||
@@ -17,7 +17,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
||||
|
||||
- **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben.
|
||||
- **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben.
|
||||
- **beta1**: Beta 1: schnelles GSQ-RCO-Testprofil mit 192K Kontext und Vision-Projektor auf der RTX 3060.
|
||||
- **beta1**: Beta 1: qualitaetsoptimiertes GSQ-RCO-IQ3_S-Testprofil; 112K Startkontext bis zur erneuten Grenzmessung.
|
||||
- **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten.
|
||||
- **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor.
|
||||
- **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert.
|
||||
|
||||
Reference in New Issue
Block a user