Restore vision projector for medium profile

This commit is contained in:
Mikei386
2026-09-01 09:19:20 +02:00
parent c031fd2c55
commit 7e14da77f9
2 changed files with 15 additions and 24 deletions
+6 -3
View File
@@ -153,12 +153,15 @@ services:
environment: environment:
NVIDIA_VISIBLE_DEVICES: ${MEDIUM_GPU_DEVICES:-0,1} NVIDIA_VISIBLE_DEVICES: ${MEDIUM_GPU_DEVICES:-0,1}
NVIDIA_DRIVER_CAPABILITIES: compute,utility NVIDIA_DRIVER_CAPABILITIES: compute,utility
# Temporary llama.cpp cache workaround: keep Medium text-only. Current MTMD_BACKEND_DEVICE: CUDA1
# multimodal builds can discard the complete KV state on a later turn.
# The model split, context and MTP settings remain unchanged.
command: command:
- --model - --model
- "/models/${MEDIUM_MODEL_FILE:?MEDIUM_MODEL_FILE is required}" - "/models/${MEDIUM_MODEL_FILE:?MEDIUM_MODEL_FILE is required}"
- --mmproj
- "/models/${VISION_PROJECTOR_FILE:?VISION_PROJECTOR_FILE is required}"
- --mmproj-offload
- --mmproj-device
- CUDA1
- --alias - --alias
- qwen-medium - qwen-medium
- --ctx-size - --ctx-size
+9 -21
View File
@@ -10,13 +10,12 @@ wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
eine Regression zu zeigen. eine Regression zu zeigen.
## Qwen Medium: vorübergehend ohne Vision-Projektor ## Qwen Medium: Vision-Projektor wieder aktiviert
`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist `qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen beendet.
kann.
Dabei gilt ausdrücklich: Dabei gilt ausdrücklich:
@@ -24,11 +23,10 @@ Dabei gilt ausdrücklich:
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt. - **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben - Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
unverändert. unverändert.
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil - Bildanalyse ist im Medium-Profil wieder verfügbar.
vorübergehend nicht verfügbar. - Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
Referenz: Referenz:
@@ -41,13 +39,3 @@ Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden. der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
## Nächster Entscheidungspunkt
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
1. identischer Mehrturn-Textchat mit MMProj,
2. identischer Mehrturn-Textchat ohne MMProj,
3. jeweils keine parallelen Hermes-Hintergrundanfragen,
4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit
vergleichen.