Update llama runtime and isolate background reviews
This commit is contained in:
1 parent
7e36f1dbb7
commit
211ede9fc5
7 files changed
+211
-28
No files matched your search
@@ -0,0 +1,53 @@
|
||||
# Aktueller temporärer Laufzustand
|
||||
|
||||
Stand: 31. August 2026
|
||||
|
||||
## Produktive llama.cpp-Runtime
|
||||
|
||||
Alle Textprofile und das Review-Modell verwenden llama.cpp Build 10718,
|
||||
Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587
|
||||
wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
|
||||
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
|
||||
eine Regression zu zeigen.
|
||||
|
||||
## Qwen Medium: vorübergehend ohne Vision-Projektor
|
||||
|
||||
`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist
|
||||
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener
|
||||
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches
|
||||
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen
|
||||
kann.
|
||||
|
||||
Dabei gilt ausdrücklich:
|
||||
|
||||
- Der Gesamtkontext bleibt bei **160.000 Tokens**.
|
||||
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
|
||||
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
|
||||
unverändert.
|
||||
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil
|
||||
vorübergehend nicht verfügbar.
|
||||
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen
|
||||
A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in
|
||||
llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
|
||||
|
||||
Referenz:
|
||||
|
||||
- https://github.com/ggml-org/llama.cpp/issues/19858
|
||||
- https://github.com/ggml-org/llama.cpp/issues/21133
|
||||
|
||||
## Separates bekanntes Problem
|
||||
|
||||
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
|
||||
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
|
||||
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
|
||||
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
|
||||
|
||||
## Nächster Entscheidungspunkt
|
||||
|
||||
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
|
||||
|
||||
1. identischer Mehrturn-Textchat mit MMProj,
|
||||
2. identischer Mehrturn-Textchat ohne MMProj,
|
||||
3. jeweils keine parallelen Hermes-Hintergrundanfragen,
|
||||
4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit
|
||||
vergleichen.
|
||||
Reference in new issue
Block a user