Files
AI-Profile-Router/docs/GSQ_RCO_BETA1_20260904.md
T

1.6 KiB
Raw Blame History

Qwen Beta 1 – GSQ-RCO

qwen-beta-1 ist ein zusätzliches, nicht standardmäßig aktives Router-Profil. Die bestehenden Profile und das Standardprofil qwen-medium bleiben unverändert.

Laufzeitkonfiguration

  • Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
  • Kontext: 112.000 Token als konservativer Startwert
  • Textmodell und KV-Cache: vollständig RTX 5080
  • Vision-Projektor: RTX 3060
  • KV-Quantisierung: Q4_0 für K und V
  • MTP: 3 Draft-Token
  • Batch / Micro-Batch: 2048 / 128

Vorherige IQ3_XXS-Kontextgrenze

Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der VRAM-Grenze verwendet.

Kontext Ergebnis Rest auf RTX 5080 nach Bildlauf
192.000 bestanden ca. 129 MiB
196.608 bestanden, harte Kante ca. 9 MiB
197.120 CUDA Out of Memory ca. 1 MiB vor Abbruch

Diese Werte gelten ausschließlich für die frühere, kleinere IQ3_XXS-MTP-Datei. Sie dürfen nicht als Grenze der größeren IQ3_S-MTP-Datei interpretiert werden. Das neue Profil startet bei 112.000 Token; seine technische und betrieblich sichere Grenze wird neu vermessen.

Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt- Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.

Austausch am 08.09.2026

Die bisherige IQ3_XXS-MTP-Datei wurde durch IQ3_S-MTP ersetzt. ISTA berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.