Upgrade Beta 1 to GSQ-RCO IQ3_S
This commit is contained in:
+2
-2
@@ -17,7 +17,7 @@ DEFAULT_REASONING_EFFORT=off
|
|||||||
|
|
||||||
FAST_MODEL_FILE=qwen-mix/Qwen3.8-27B-IQ4-MIX.gguf
|
FAST_MODEL_FILE=qwen-mix/Qwen3.8-27B-IQ4-MIX.gguf
|
||||||
MEDIUM_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
MEDIUM_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-test/Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf
|
BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-iq3s/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf
|
||||||
LARGE_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
LARGE_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
ULTRA_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
ULTRA_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
UNCENSORED_MODEL_FILE=qwen3.8-27b-abliterated/Qwen3.8-27B-ABLITERATED-Q4_K_M.gguf
|
UNCENSORED_MODEL_FILE=qwen3.8-27b-abliterated/Qwen3.8-27B-ABLITERATED-Q4_K_M.gguf
|
||||||
@@ -30,7 +30,7 @@ FAST_UBATCH_SIZE=32
|
|||||||
MEDIUM_CONTEXT=160000
|
MEDIUM_CONTEXT=160000
|
||||||
MEDIUM_BATCH_SIZE=2048
|
MEDIUM_BATCH_SIZE=2048
|
||||||
MEDIUM_UBATCH_SIZE=128
|
MEDIUM_UBATCH_SIZE=128
|
||||||
BETA1_CONTEXT=192000
|
BETA1_CONTEXT=112000
|
||||||
BETA1_BATCH_SIZE=2048
|
BETA1_BATCH_SIZE=2048
|
||||||
BETA1_UBATCH_SIZE=128
|
BETA1_UBATCH_SIZE=128
|
||||||
LARGE_CONTEXT=192000
|
LARGE_CONTEXT=192000
|
||||||
|
|||||||
+5
-4
@@ -235,9 +235,10 @@ services:
|
|||||||
- --spec-draft-p-min
|
- --spec-draft-p-min
|
||||||
- "0.05"
|
- "0.05"
|
||||||
|
|
||||||
# Beta 1 keeps the complete GSQ-RCO text model and KV cache on the RTX 5080.
|
# Beta 1 keeps the complete GSQ-RCO IQ3_S text model and KV cache on the RTX
|
||||||
# Only the multimodal projector runs on the RTX 3060. The measured hard
|
# 5080. Only the multimodal projector runs on the RTX 3060. The larger IQ3_S
|
||||||
# boundary is 196608 tokens; 192K deliberately retains runtime headroom.
|
# build starts conservatively at 112K until its hard context boundary has
|
||||||
|
# been measured; the former IQ3_XXS result does not transfer to this file.
|
||||||
llama-beta1:
|
llama-beta1:
|
||||||
<<: *llama-common
|
<<: *llama-common
|
||||||
container_name: mike-ai-llama-beta1
|
container_name: mike-ai-llama-beta1
|
||||||
@@ -258,7 +259,7 @@ services:
|
|||||||
- --alias
|
- --alias
|
||||||
- qwen-beta-1
|
- qwen-beta-1
|
||||||
- --ctx-size
|
- --ctx-size
|
||||||
- "${BETA1_CONTEXT:-192000}"
|
- "${BETA1_CONTEXT:-112000}"
|
||||||
- --flash-attn
|
- --flash-attn
|
||||||
- "on"
|
- "on"
|
||||||
- --cache-type-k
|
- --cache-type-k
|
||||||
|
|||||||
@@ -60,9 +60,9 @@ FAST_MODEL_SHA256=54879ae8738d5938f46cb3b8cbf16bf42b8c85b7d68d7c73f062b612ec183e
|
|||||||
MEDIUM_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
MEDIUM_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
MEDIUM_MODEL_URL=https://huggingface.co/jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF/resolve/main/qwen3.8-27b-IQ4_XS-pure.gguf
|
MEDIUM_MODEL_URL=https://huggingface.co/jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF/resolve/main/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
MEDIUM_MODEL_SHA256=ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675
|
MEDIUM_MODEL_SHA256=ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675
|
||||||
BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-test/Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf
|
BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-iq3s/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf
|
||||||
BETA1_MODEL_URL=https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/resolve/main/Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf
|
BETA1_MODEL_URL=https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/resolve/main/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf
|
||||||
BETA1_MODEL_SHA256=63f29a2189a6b4cc31f81e093d3856ad293a5583114439f41ae1ed7af4093262
|
BETA1_MODEL_SHA256=58fd826723939933dc86f45b7fe04545cbc2de1c70f6fe2cdd3858c87a98c12f
|
||||||
LARGE_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
LARGE_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
LARGE_MODEL_URL=https://huggingface.co/jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF/resolve/main/qwen3.8-27b-IQ4_XS-pure.gguf
|
LARGE_MODEL_URL=https://huggingface.co/jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF/resolve/main/qwen3.8-27b-IQ4_XS-pure.gguf
|
||||||
LARGE_MODEL_SHA256=ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675
|
LARGE_MODEL_SHA256=ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675
|
||||||
|
|||||||
@@ -30,14 +30,14 @@
|
|||||||
{
|
{
|
||||||
"id": "beta1",
|
"id": "beta1",
|
||||||
"alias": "qwen-beta-1",
|
"alias": "qwen-beta-1",
|
||||||
"context": 192000,
|
"context": 112000,
|
||||||
"parallel_slots": 1,
|
"parallel_slots": 1,
|
||||||
"model_env": "BETA1_MODEL_FILE",
|
"model_env": "BETA1_MODEL_FILE",
|
||||||
"model_family": "Qwen3.8-27B GSQ-RCO IQ3_XXS MTP",
|
"model_family": "Qwen3.8-27B GSQ-RCO IQ3_S MTP",
|
||||||
"gpu_split": "5080 model / 3060 vision",
|
"gpu_split": "5080 model / 3060 vision",
|
||||||
"vision": true,
|
"vision": true,
|
||||||
"mtp": 3,
|
"mtp": 3,
|
||||||
"description": "Beta 1: schnelles GSQ-RCO-Testprofil mit 192K Kontext und Vision-Projektor auf der RTX 3060."
|
"description": "Beta 1: qualitaetsoptimiertes GSQ-RCO-IQ3_S-Testprofil; 112K Startkontext bis zur erneuten Grenzmessung."
|
||||||
},
|
},
|
||||||
{
|
{
|
||||||
"id": "large",
|
"id": "large",
|
||||||
|
|||||||
@@ -5,15 +5,15 @@ Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unveränder
|
|||||||
|
|
||||||
## Laufzeitkonfiguration
|
## Laufzeitkonfiguration
|
||||||
|
|
||||||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_XXS MTP
|
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
|
||||||
- Kontext: 192.000 Token
|
- Kontext: 112.000 Token als konservativer Startwert
|
||||||
- Textmodell und KV-Cache: vollständig RTX 5080
|
- Textmodell und KV-Cache: vollständig RTX 5080
|
||||||
- Vision-Projektor: RTX 3060
|
- Vision-Projektor: RTX 3060
|
||||||
- KV-Quantisierung: Q4_0 für K und V
|
- KV-Quantisierung: Q4_0 für K und V
|
||||||
- MTP: 3 Draft-Token
|
- MTP: 3 Draft-Token
|
||||||
- Batch / Micro-Batch: 2048 / 128
|
- Batch / Micro-Batch: 2048 / 128
|
||||||
|
|
||||||
## Gemessene Kontextgrenze
|
## Vorherige IQ3_XXS-Kontextgrenze
|
||||||
|
|
||||||
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
||||||
VRAM-Grenze verwendet.
|
VRAM-Grenze verwendet.
|
||||||
@@ -24,9 +24,18 @@ VRAM-Grenze verwendet.
|
|||||||
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
||||||
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
||||||
|
|
||||||
Der produktive Beta-Modus verwendet deshalb 192.000 Token. 196.608 ist nur
|
Diese Werte gelten ausschließlich für die frühere, kleinere
|
||||||
die gemessene technische Obergrenze und besitzt keine ausreichende Reserve
|
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
|
||||||
für einen verlässlichen Dauerbetrieb.
|
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
|
||||||
|
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
|
||||||
|
|
||||||
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
||||||
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|
||||||
|
|
||||||
|
## Austausch am 08.09.2026
|
||||||
|
|
||||||
|
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
|
||||||
|
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
|
||||||
|
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
|
||||||
|
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
|
||||||
|
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
|
||||||
|
|||||||
@@ -8,7 +8,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
|||||||
|---|---|---:|---:|---|---|---|---:|
|
|---|---|---:|---:|---|---|---|---:|
|
||||||
| fast | `qwen-fast` | 76,800 | 1 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
|
| fast | `qwen-fast` | 76,800 | 1 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
|
||||||
| medium | `qwen-medium` | 160,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 85:15 | ja | 3 |
|
| medium | `qwen-medium` | 160,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 85:15 | ja | 3 |
|
||||||
| beta1 | `qwen-beta-1` | 192,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_XXS MTP | 5080 model / 3060 vision | ja | 3 |
|
| beta1 | `qwen-beta-1` | 112,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_S MTP | 5080 model / 3060 vision | ja | 3 |
|
||||||
| large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
|
| large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
|
||||||
| ultra | `qwen-ultra` | 262,144 | 1 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
|
| ultra | `qwen-ultra` | 262,144 | 1 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
|
||||||
| uncensored | `qwen-uncensored` | 80,000 | 1 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |
|
| uncensored | `qwen-uncensored` | 80,000 | 1 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |
|
||||||
@@ -17,7 +17,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
|||||||
|
|
||||||
- **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben.
|
- **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben.
|
||||||
- **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben.
|
- **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben.
|
||||||
- **beta1**: Beta 1: schnelles GSQ-RCO-Testprofil mit 192K Kontext und Vision-Projektor auf der RTX 3060.
|
- **beta1**: Beta 1: qualitaetsoptimiertes GSQ-RCO-IQ3_S-Testprofil; 112K Startkontext bis zur erneuten Grenzmessung.
|
||||||
- **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten.
|
- **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten.
|
||||||
- **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor.
|
- **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor.
|
||||||
- **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert.
|
- **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert.
|
||||||
|
|||||||
@@ -9,7 +9,7 @@
|
|||||||
"model_alias": "qwen-medium"
|
"model_alias": "qwen-medium"
|
||||||
},
|
},
|
||||||
"beta1": {
|
"beta1": {
|
||||||
"context": 192000,
|
"context": 112000,
|
||||||
"model_alias": "qwen-beta-1"
|
"model_alias": "qwen-beta-1"
|
||||||
},
|
},
|
||||||
"large": {
|
"large": {
|
||||||
|
|||||||
Reference in New Issue
Block a user