Restore vision projector for medium profile

This commit is contained in:
Mikei386
2026-09-01 09:19:20 +02:00
parent c031fd2c55
commit 7e14da77f9
2 changed files with 15 additions and 24 deletions
+9 -21
View File
@@ -10,13 +10,12 @@ wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
eine Regression zu zeigen.
## Qwen Medium: vorübergehend ohne Vision-Projektor
## Qwen Medium: Vision-Projektor wieder aktiviert
`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen
kann.
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
beendet.
Dabei gilt ausdrücklich:
@@ -24,11 +23,10 @@ Dabei gilt ausdrücklich:
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
unverändert.
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil
vorübergehend nicht verfügbar.
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen
A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in
llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
- Bildanalyse ist im Medium-Profil wieder verfügbar.
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
Referenz:
@@ -41,13 +39,3 @@ Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
## Nächster Entscheidungspunkt
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
1. identischer Mehrturn-Textchat mit MMProj,
2. identischer Mehrturn-Textchat ohne MMProj,
3. jeweils keine parallelen Hermes-Hintergrundanfragen,
4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit
vergleichen.