Update llama runtime and isolate background reviews

This commit is contained in:
Mikei386 committed 2026-08-31 21:11:17 +02:00
1 parent 7e36f1dbb7
commit 211ede9fc5
7 files changed
+211 -28

No files matched your search

+53
View File
@@ -0,0 +1,53 @@
# Aktueller temporärer Laufzustand
Stand: 31. August 2026
## Produktive llama.cpp-Runtime
Alle Textprofile und das Review-Modell verwenden llama.cpp Build 10718,
Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587
wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
eine Regression zu zeigen.
## Qwen Medium: vorübergehend ohne Vision-Projektor
`qwen-medium` läuft aktuell als reines Textprofil **ohne `--mmproj`**. Das ist
ein vorläufiger Workaround für einen llama.cpp-Fehler, bei dem ein geladener
Multimodal-/Vision-Projektor die Wiederverwendung des Prompt-/KV-Caches
verhindern und dadurch eine vollständige erneute Prompt-Verarbeitung auslösen
kann.
Dabei gilt ausdrücklich:
- Der Gesamtkontext bleibt bei **160.000 Tokens**.
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
unverändert.
- Nur die Bildanalyse über den Qwen-Vision-Projektor ist im Medium-Profil
vorübergehend nicht verfügbar.
- Der Workaround ist noch nicht durch einen vollständig kontrollierten lokalen
A/B-Test mit identischen Anfragen bestätigt. Er entspricht jedoch dem in
llama.cpp Issue #19858 und verwandten Meldungen beschriebenen Workaround.
Referenz:
- https://github.com/ggml-org/llama.cpp/issues/19858
- https://github.com/ggml-org/llama.cpp/issues/21133
## Separates bekanntes Problem
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
## Nächster Entscheidungspunkt
Vor einer dauerhaften Übernahme kontrolliert vergleichen:
1. identischer Mehrturn-Textchat mit MMProj,
2. identischer Mehrturn-Textchat ohne MMProj,
3. jeweils keine parallelen Hermes-Hintergrundanfragen,
4. gelesene beziehungsweise erneut verarbeitete Prompt-Tokens und Prefill-Zeit
vergleichen.