Enable cross-chat llama prompt cache reuse
This commit is contained in:
1 parent
57afdd4f15
commit
d921dfaf69
7 files changed
+60
-5
No files matched your search
@@ -43,6 +43,9 @@ Zielplattform.
|
||||
- RTX 5080 + RTX 3060 im Verhältnis 90:10
|
||||
- Flash Attention
|
||||
- KV-Cache Q4_0 für K und V
|
||||
- explizites Prompt-Caching mit 8.192 MiB profilinternem RAM-Cache
|
||||
- `--cache-reuse 256` für die Wiederverwendung langer stabiler Präfixe trotz
|
||||
kleiner späterer Abweichungen
|
||||
- MTP Draft, maximal drei Tokens
|
||||
- MTP-Akzeptanzschwelle 0,05; im Referenzlauf 77,26 statt 73,88 Tok/s
|
||||
- sechs Threads und sechs Batch-Threads
|
||||
@@ -96,6 +99,18 @@ Der Router übernimmt:
|
||||
|
||||
## Hermes Agent
|
||||
|
||||
- Hermes 0.20.5 baut den Systemprompt bereits in drei geordneten Bereichen:
|
||||
einen chatübergreifend stabilen Präfix, sitzungsstabilen Kontext und einen
|
||||
variablen Nachlauf. Der stabile Präfix bleibt bei gleicher Profil- und
|
||||
Werkzeugkonfiguration wortgleich und kann dadurch vom llama.cpp-RAM-Cache
|
||||
wiederverwendet werden.
|
||||
- Der RAM-Promptcache lebt nur so lange wie der jeweilige llama.cpp-Prozess.
|
||||
Ein Profilwechsel entlädt das bisherige Modell und damit dessen Cache.
|
||||
- Persistente Slot-Dateien (`--slot-save-path`) sind vorerst bewusst nicht
|
||||
aktiviert. Die aktuelle llama.cpp-Linie hat offene Restore-Fehler; ein
|
||||
gemeldetes erfolgreiches Restore kann trotzdem einen vollständigen Prefill
|
||||
auslösen. Erst nach einem isolierten Regressionstest aktivieren.
|
||||
|
||||
- Kontextkompression läuft spätestens bei 60.000 Token; die relative
|
||||
65-Prozent-Grenze greift nur, wenn sie noch früher erreicht wird. Damit gilt
|
||||
dieselbe Obergrenze auch für Medium, Large und Ultra und ein Profilwechsel
|
||||
|
||||
Reference in new issue
Block a user