2.1 KiB
Aktueller temporärer Laufzustand
Stand: 31. August 2026
Produktive llama.cpp-Runtime
Alle Textprofile und das Review-Modell verwenden llama.cpp Build 10718,
Commit 41ef91f7c8046087cdfbb276b79bff311ecf1c6d. Der vorherige Build 10587
wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
eine Regression zu zeigen.
Qwen Medium: vorübergehend ohne Vision-Projektor
qwen-medium läuft aktuell als reines Textprofil ohne --mmproj. Das ist
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen
kann.
Dabei gilt ausdrücklich:
- Der Gesamtkontext bleibt bei 160.000 Tokens.
- MTP / Speculative Decoding bleibt aktiviert; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert.
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil vorübergehend nicht verfügbar.
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
Referenz:
- https://github.com/ggml-org/llama.cpp/issues/19858
- https://github.com/ggml-org/llama.cpp/issues/21133
Separates bekanntes Problem
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
Nächster Entscheidungspunkt
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
- identischer Mehrturn-Textchat mit MMProj,
- identischer Mehrturn-Textchat ohne MMProj,
- jeweils keine parallelen Hermes-Hintergrundanfragen,
- gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit vergleichen.