From f7ff14a1ce7d3884ecd57d3df27a8ee1a70b3dac Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Tue, 8 Sep 2026 11:46:52 +0200 Subject: [PATCH] Upgrade Beta 1 to GSQ-RCO IQ3_S --- .env.example | 4 ++-- compose.yaml | 9 +++++---- config/install.env.example | 6 +++--- config/profile-matrix.json | 6 +++--- docs/GSQ_RCO_BETA1_20260904.md | 21 +++++++++++++++------ docs/STANDARD_PROFILE_MATRIX.md | 4 ++-- router/router_profiles.json | 2 +- 7 files changed, 31 insertions(+), 21 deletions(-) diff --git a/.env.example b/.env.example index ff7c69f..825ecd9 100644 --- a/.env.example +++ b/.env.example @@ -17,7 +17,7 @@ DEFAULT_REASONING_EFFORT=off FAST_MODEL_FILE=qwen-mix/Qwen3.8-27B-IQ4-MIX.gguf MEDIUM_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf -BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-test/Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf +BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-iq3s/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf LARGE_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf ULTRA_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf UNCENSORED_MODEL_FILE=qwen3.8-27b-abliterated/Qwen3.8-27B-ABLITERATED-Q4_K_M.gguf @@ -30,7 +30,7 @@ FAST_UBATCH_SIZE=32 MEDIUM_CONTEXT=160000 MEDIUM_BATCH_SIZE=2048 MEDIUM_UBATCH_SIZE=128 -BETA1_CONTEXT=192000 +BETA1_CONTEXT=112000 BETA1_BATCH_SIZE=2048 BETA1_UBATCH_SIZE=128 LARGE_CONTEXT=192000 diff --git a/compose.yaml b/compose.yaml index 7c73900..08535be 100644 --- a/compose.yaml +++ b/compose.yaml @@ -235,9 +235,10 @@ services: - --spec-draft-p-min - "0.05" - # Beta 1 keeps the complete GSQ-RCO text model and KV cache on the RTX 5080. - # Only the multimodal projector runs on the RTX 3060. The measured hard - # boundary is 196608 tokens; 192K deliberately retains runtime headroom. + # Beta 1 keeps the complete GSQ-RCO IQ3_S text model and KV cache on the RTX + # 5080. Only the multimodal projector runs on the RTX 3060. The larger IQ3_S + # build starts conservatively at 112K until its hard context boundary has + # been measured; the former IQ3_XXS result does not transfer to this file. llama-beta1: <<: *llama-common container_name: mike-ai-llama-beta1 @@ -258,7 +259,7 @@ services: - --alias - qwen-beta-1 - --ctx-size - - "${BETA1_CONTEXT:-192000}" + - "${BETA1_CONTEXT:-112000}" - --flash-attn - "on" - --cache-type-k diff --git a/config/install.env.example b/config/install.env.example index 2397581..f35c61e 100644 --- a/config/install.env.example +++ b/config/install.env.example @@ -60,9 +60,9 @@ FAST_MODEL_SHA256=54879ae8738d5938f46cb3b8cbf16bf42b8c85b7d68d7c73f062b612ec183e MEDIUM_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf MEDIUM_MODEL_URL=https://huggingface.co/jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF/resolve/main/qwen3.8-27b-IQ4_XS-pure.gguf MEDIUM_MODEL_SHA256=ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675 -BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-test/Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf -BETA1_MODEL_URL=https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/resolve/main/Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf -BETA1_MODEL_SHA256=63f29a2189a6b4cc31f81e093d3856ad293a5583114439f41ae1ed7af4093262 +BETA1_MODEL_FILE=qwen3.8-27b-gsq-rco-iq3s/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf +BETA1_MODEL_URL=https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/resolve/main/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf +BETA1_MODEL_SHA256=58fd826723939933dc86f45b7fe04545cbc2de1c70f6fe2cdd3858c87a98c12f LARGE_MODEL_FILE=qwen-pure/qwen3.8-27b-IQ4_XS-pure.gguf LARGE_MODEL_URL=https://huggingface.co/jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF/resolve/main/qwen3.8-27b-IQ4_XS-pure.gguf LARGE_MODEL_SHA256=ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675 diff --git a/config/profile-matrix.json b/config/profile-matrix.json index 0f5cf62..32cc6db 100644 --- a/config/profile-matrix.json +++ b/config/profile-matrix.json @@ -30,14 +30,14 @@ { "id": "beta1", "alias": "qwen-beta-1", - "context": 192000, + "context": 112000, "parallel_slots": 1, "model_env": "BETA1_MODEL_FILE", - "model_family": "Qwen3.8-27B GSQ-RCO IQ3_XXS MTP", + "model_family": "Qwen3.8-27B GSQ-RCO IQ3_S MTP", "gpu_split": "5080 model / 3060 vision", "vision": true, "mtp": 3, - "description": "Beta 1: schnelles GSQ-RCO-Testprofil mit 192K Kontext und Vision-Projektor auf der RTX 3060." + "description": "Beta 1: qualitaetsoptimiertes GSQ-RCO-IQ3_S-Testprofil; 112K Startkontext bis zur erneuten Grenzmessung." }, { "id": "large", diff --git a/docs/GSQ_RCO_BETA1_20260904.md b/docs/GSQ_RCO_BETA1_20260904.md index c8b3031..293eaf7 100644 --- a/docs/GSQ_RCO_BETA1_20260904.md +++ b/docs/GSQ_RCO_BETA1_20260904.md @@ -5,15 +5,15 @@ Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unveränder ## Laufzeitkonfiguration -- Modell: Qwen3.8-27B GSQ-RCO IQ3_XXS MTP -- Kontext: 192.000 Token +- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP +- Kontext: 112.000 Token als konservativer Startwert - Textmodell und KV-Cache: vollständig RTX 5080 - Vision-Projektor: RTX 3060 - KV-Quantisierung: Q4_0 für K und V - MTP: 3 Draft-Token - Batch / Micro-Batch: 2048 / 128 -## Gemessene Kontextgrenze +## Vorherige IQ3_XXS-Kontextgrenze Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der VRAM-Grenze verwendet. @@ -24,9 +24,18 @@ VRAM-Grenze verwendet. | 196.608 | bestanden, harte Kante | ca. 9 MiB | | 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch | -Der produktive Beta-Modus verwendet deshalb 192.000 Token. 196.608 ist nur -die gemessene technische Obergrenze und besitzt keine ausreichende Reserve -für einen verlässlichen Dauerbetrieb. +Diese Werte gelten ausschließlich für die frühere, kleinere +`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren +`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000 +Token; seine technische und betrieblich sichere Grenze wird neu vermessen. Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt- Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben. + +## Austausch am 08.09.2026 + +Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA +berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf +AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese +Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale +Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben. diff --git a/docs/STANDARD_PROFILE_MATRIX.md b/docs/STANDARD_PROFILE_MATRIX.md index b2e3ea4..f16f20f 100644 --- a/docs/STANDARD_PROFILE_MATRIX.md +++ b/docs/STANDARD_PROFILE_MATRIX.md @@ -8,7 +8,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token** |---|---|---:|---:|---|---|---|---:| | fast | `qwen-fast` | 76,800 | 1 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 | | medium | `qwen-medium` | 160,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 85:15 | ja | 3 | -| beta1 | `qwen-beta-1` | 192,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_XXS MTP | 5080 model / 3060 vision | ja | 3 | +| beta1 | `qwen-beta-1` | 112,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_S MTP | 5080 model / 3060 vision | ja | 3 | | large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 | | ultra | `qwen-ultra` | 262,144 | 1 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 | | uncensored | `qwen-uncensored` | 80,000 | 1 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 | @@ -17,7 +17,7 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token** - **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben. - **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben. -- **beta1**: Beta 1: schnelles GSQ-RCO-Testprofil mit 192K Kontext und Vision-Projektor auf der RTX 3060. +- **beta1**: Beta 1: qualitaetsoptimiertes GSQ-RCO-IQ3_S-Testprofil; 112K Startkontext bis zur erneuten Grenzmessung. - **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten. - **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor. - **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert. diff --git a/router/router_profiles.json b/router/router_profiles.json index 4782b65..2950f7e 100644 --- a/router/router_profiles.json +++ b/router/router_profiles.json @@ -9,7 +9,7 @@ "model_alias": "qwen-medium" }, "beta1": { - "context": 192000, + "context": 112000, "model_alias": "qwen-beta-1" }, "large": {