# Aktueller temporärer Laufzustand Stand: 31. August 2026 ## Produktive llama.cpp-Runtime Alle Textprofile verwenden llama.cpp Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587 wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest eine Regression zu zeigen. ## Qwen Medium: vorübergehend ohne Vision-Projektor `qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen kann. Dabei gilt ausdrücklich: - Der Gesamtkontext bleibt bei **160.000 Tokens**. - **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt. - Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert. - Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil vorübergehend nicht verfügbar. - Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround. Referenz: - https://github.com/ggml-org/llama.cpp/issues/19858 - https://github.com/ggml-org/llama.cpp/issues/21133 ## Separates bekanntes Problem Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden. ## Nächster Entscheidungspunkt Vor einer dauerhaften Übernahme kontrolliert vergleichen: 1. identischer Mehrturn-Textchat mit MMProj, 2. identischer Mehrturn-Textchat ohne MMProj, 3. jeweils keine parallelen Hermes-Hintergrundanfragen, 4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit vergleichen.