Restore vision projector for medium profile
This commit is contained in:
@@ -10,13 +10,12 @@ wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
|
||||
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
|
||||
eine Regression zu zeigen.
|
||||
|
||||
## Qwen Medium: vorübergehend ohne Vision-Projektor
|
||||
## Qwen Medium: Vision-Projektor wieder aktiviert
|
||||
|
||||
`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist
|
||||
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener
|
||||
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches
|
||||
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen
|
||||
kann.
|
||||
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
|
||||
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
|
||||
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
|
||||
beendet.
|
||||
|
||||
Dabei gilt ausdrücklich:
|
||||
|
||||
@@ -24,11 +23,10 @@ Dabei gilt ausdrücklich:
|
||||
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
|
||||
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
|
||||
unverändert.
|
||||
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil
|
||||
vorübergehend nicht verfügbar.
|
||||
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen
|
||||
A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in
|
||||
llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
|
||||
- Bildanalyse ist im Medium-Profil wieder verfügbar.
|
||||
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
|
||||
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
|
||||
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
|
||||
|
||||
Referenz:
|
||||
|
||||
@@ -41,13 +39,3 @@ Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
|
||||
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
|
||||
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
|
||||
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
|
||||
|
||||
## Nächster Entscheidungspunkt
|
||||
|
||||
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
|
||||
|
||||
1. identischer Mehrturn-Textchat mit MMProj,
|
||||
2. identischer Mehrturn-Textchat ohne MMProj,
|
||||
3. jeweils keine parallelen Hermes-Hintergrundanfragen,
|
||||
4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit
|
||||
vergleichen.
|
||||
|
||||
Reference in New Issue
Block a user