# Aktueller temporärer Laufzustand Stand: 31. August 2026 ## Produktive llama.cpp-Runtime Alle Textprofile verwenden llama.cpp Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587 wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest eine Regression zu zeigen. ## Qwen Medium: Vision-Projektor wieder aktiviert `qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen. Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch beendet. Dabei gilt ausdrücklich: - Der Gesamtkontext bleibt bei **160.000 Tokens**. - **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt. - Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert. - Bildanalyse ist im Medium-Profil wieder verfügbar. - Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird zugunsten der benötigten Vision-Funktion bewusst akzeptiert. Referenz: - https://github.com/ggml-org/llama.cpp/issues/19858 - https://github.com/ggml-org/llama.cpp/issues/21133 ## Separates bekanntes Problem Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.