diff --git a/compose.yaml b/compose.yaml index 0d3b48c..1f27168 100644 --- a/compose.yaml +++ b/compose.yaml @@ -153,12 +153,15 @@ services: environment: NVIDIA_VISIBLE_DEVICES: ${MEDIUM_GPU_DEVICES:-0,1} NVIDIA_DRIVER_CAPABILITIES: compute,utility - # Temporary llama.cpp cache workaround: keep Medium text-only. Current - # multimodal builds can discard the complete KV state on a later turn. - # The model split, context and MTP settings remain unchanged. + MTMD_BACKEND_DEVICE: CUDA1 command: - --model - "/models/${MEDIUM_MODEL_FILE:?MEDIUM_MODEL_FILE is required}" + - --mmproj + - "/models/${VISION_PROJECTOR_FILE:?VISION_PROJECTOR_FILE is required}" + - --mmproj-offload + - --mmproj-device + - CUDA1 - --alias - qwen-medium - --ctx-size diff --git a/docs/CURRENT_RUNTIME_NOTES.md b/docs/CURRENT_RUNTIME_NOTES.md index 5772834..22dec58 100644 --- a/docs/CURRENT_RUNTIME_NOTES.md +++ b/docs/CURRENT_RUNTIME_NOTES.md @@ -10,13 +10,12 @@ wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest eine Regression zu zeigen. -## Qwen Medium: vorübergehend ohne Vision-Projektor +## Qwen Medium: Vision-Projektor wieder aktiviert -`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist -ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener -Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches -verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen -kann. +`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird +über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen. +Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch +beendet. Dabei gilt ausdrücklich: @@ -24,11 +23,10 @@ Dabei gilt ausdrücklich: - **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt. - Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert. -- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil - vorübergehend nicht verfügbar. -- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen - A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in - llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround. +- Bildanalyse ist im Medium-Profil wieder verfügbar. +- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige + Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird + zugunsten der benötigten Vision-Funktion bewusst akzeptiert. Referenz: @@ -41,13 +39,3 @@ Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden. - -## Nächster Entscheidungspunkt - -Vor einer dauerhaften Übernahme kontrolliert vergleichen: - -1. identischer Mehrturn-Textchat mit MMProj, -2. identischer Mehrturn-Textchat ohne MMProj, -3. jeweils keine parallelen Hermes-Hintergrundanfragen, -4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit - vergleichen.