Restore vision projector for medium profile
This commit is contained in:
+6
-3
@@ -153,12 +153,15 @@ services:
|
|||||||
environment:
|
environment:
|
||||||
NVIDIA_VISIBLE_DEVICES: ${MEDIUM_GPU_DEVICES:-0,1}
|
NVIDIA_VISIBLE_DEVICES: ${MEDIUM_GPU_DEVICES:-0,1}
|
||||||
NVIDIA_DRIVER_CAPABILITIES: compute,utility
|
NVIDIA_DRIVER_CAPABILITIES: compute,utility
|
||||||
# Temporary llama.cpp cache workaround: keep Medium text-only. Current
|
MTMD_BACKEND_DEVICE: CUDA1
|
||||||
# multimodal builds can discard the complete KV state on a later turn.
|
|
||||||
# The model split, context and MTP settings remain unchanged.
|
|
||||||
command:
|
command:
|
||||||
- --model
|
- --model
|
||||||
- "/models/${MEDIUM_MODEL_FILE:?MEDIUM_MODEL_FILE is required}"
|
- "/models/${MEDIUM_MODEL_FILE:?MEDIUM_MODEL_FILE is required}"
|
||||||
|
- --mmproj
|
||||||
|
- "/models/${VISION_PROJECTOR_FILE:?VISION_PROJECTOR_FILE is required}"
|
||||||
|
- --mmproj-offload
|
||||||
|
- --mmproj-device
|
||||||
|
- CUDA1
|
||||||
- --alias
|
- --alias
|
||||||
- qwen-medium
|
- qwen-medium
|
||||||
- --ctx-size
|
- --ctx-size
|
||||||
|
|||||||
@@ -10,13 +10,12 @@ wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
|
|||||||
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
|
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
|
||||||
eine Regression zu zeigen.
|
eine Regression zu zeigen.
|
||||||
|
|
||||||
## Qwen Medium: vorübergehend ohne Vision-Projektor
|
## Qwen Medium: Vision-Projektor wieder aktiviert
|
||||||
|
|
||||||
`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist
|
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
|
||||||
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener
|
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
|
||||||
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches
|
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
|
||||||
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen
|
beendet.
|
||||||
kann.
|
|
||||||
|
|
||||||
Dabei gilt ausdrücklich:
|
Dabei gilt ausdrücklich:
|
||||||
|
|
||||||
@@ -24,11 +23,10 @@ Dabei gilt ausdrücklich:
|
|||||||
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
|
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
|
||||||
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
|
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
|
||||||
unverändert.
|
unverändert.
|
||||||
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil
|
- Bildanalyse ist im Medium-Profil wieder verfügbar.
|
||||||
vorübergehend nicht verfügbar.
|
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
|
||||||
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen
|
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
|
||||||
A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in
|
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
|
||||||
llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
|
|
||||||
|
|
||||||
Referenz:
|
Referenz:
|
||||||
|
|
||||||
@@ -41,13 +39,3 @@ Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
|
|||||||
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
|
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
|
||||||
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
|
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
|
||||||
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
|
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
|
||||||
|
|
||||||
## Nächster Entscheidungspunkt
|
|
||||||
|
|
||||||
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
|
|
||||||
|
|
||||||
1. identischer Mehrturn-Textchat mit MMProj,
|
|
||||||
2. identischer Mehrturn-Textchat ohne MMProj,
|
|
||||||
3. jeweils keine parallelen Hermes-Hintergrundanfragen,
|
|
||||||
4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit
|
|
||||||
vergleichen.
|
|
||||||
|
|||||||
Reference in New Issue
Block a user