Enable cross-chat llama prompt cache reuse

This commit is contained in:
Mikei386 committed 2026-08-25 19:19:49 +02:00
1 parent 57afdd4f15
commit d921dfaf69
7 files changed
+60 -5

No files matched your search

+15
View File
@@ -43,6 +43,9 @@ Zielplattform.
- RTX 5080 + RTX 3060 im Verhältnis 90:10
- Flash Attention
- KV-Cache Q4_0 für K und V
- explizites Prompt-Caching mit 8.192 MiB profilinternem RAM-Cache
- `--cache-reuse 256` für die Wiederverwendung langer stabiler Präfixe trotz
kleiner späterer Abweichungen
- MTP Draft, maximal drei Tokens
- MTP-Akzeptanzschwelle 0,05; im Referenzlauf 77,26 statt 73,88 Tok/s
- sechs Threads und sechs Batch-Threads
@@ -96,6 +99,18 @@ Der Router übernimmt:
## Hermes Agent
- Hermes 0.20.5 baut den Systemprompt bereits in drei geordneten Bereichen:
einen chatübergreifend stabilen Präfix, sitzungsstabilen Kontext und einen
variablen Nachlauf. Der stabile Präfix bleibt bei gleicher Profil- und
Werkzeugkonfiguration wortgleich und kann dadurch vom llama.cpp-RAM-Cache
wiederverwendet werden.
- Der RAM-Promptcache lebt nur so lange wie der jeweilige llama.cpp-Prozess.
Ein Profilwechsel entlädt das bisherige Modell und damit dessen Cache.
- Persistente Slot-Dateien (`--slot-save-path`) sind vorerst bewusst nicht
aktiviert. Die aktuelle llama.cpp-Linie hat offene Restore-Fehler; ein
gemeldetes erfolgreiches Restore kann trotzdem einen vollständigen Prefill
auslösen. Erst nach einem isolierten Regressionstest aktivieren.
- Kontextkompression läuft spätestens bei 60.000 Token; die relative
65-Prozent-Grenze greift nur, wenn sie noch früher erreicht wird. Damit gilt
dieselbe Obergrenze auch für Medium, Large und Ultra und ein Profilwechsel