Limit prompt cache reuse to text-only profiles
This commit is contained in:
@@ -44,8 +44,14 @@ Zielplattform.
|
||||
- Flash Attention
|
||||
- KV-Cache Q4_0 für K und V
|
||||
- explizites Prompt-Caching mit 8.192 MiB profilinternem RAM-Cache
|
||||
- `--cache-reuse 256` für die Wiederverwendung langer stabiler Präfixe trotz
|
||||
kleiner späterer Abweichungen
|
||||
- exakte Wiederverwendung bereits verarbeiteter Prompt-Präfixe über
|
||||
`--cache-prompt`; Hermes trennt seinen System-Prompt zusätzlich in einen
|
||||
stabilen, einen kontextabhängigen und einen flüchtigen Teil
|
||||
- `--cache-reuse 256` nur in den text-only-Profilen Ultra und Experimental;
|
||||
llama.cpp deaktiviert diese unscharfe Wiederverwendung ausdrücklich, sobald
|
||||
ein Vision-Projektor geladen ist
|
||||
- kein persistenter Slot-Cache auf Datenträger, bis die bekannten
|
||||
llama.cpp-Restore-Regressions behoben sind
|
||||
- MTP Draft, maximal drei Tokens
|
||||
- MTP-Akzeptanzschwelle 0,05; im Referenzlauf 77,26 statt 73,88 Tok/s
|
||||
- sechs Threads und sechs Batch-Threads
|
||||
|
||||
Reference in New Issue
Block a user