Update llama.cpp to build 10781

This commit is contained in:
Mikei386 committed 2026-09-03 12:09:10 +02:00
1 parent fb0cb40bed
commit b0ecc83462
3 files changed
+14 -14

No files matched your search

+1 -1
View File
@@ -1 +1 @@
41ef91f7c8046087cdfbb276b79bff311ecf1c6d
c7bda030e7faee594dbe7550185e857351ad405d
+5 -7
View File
@@ -21,13 +21,11 @@ nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
- Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige
Projektor liegt vollständig auf der RTX 3060
Die produktive Runtime ist auf llama.cpp Build 10718, Commit
`41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, festgeschrieben. Im lokalen
A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache
unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von
56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren
Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn
auch auf Qwen3.8 anzuwenden.
Die produktive Runtime ist auf llama.cpp Build 10781, Commit
`c7bda030e7faee594dbe7550185e857351ad405d`, festgeschrieben. Dieser Stand
enthält die ab Build 10751 verfügbare Korrektur für eine zwischenzeitliche
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`.
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes
werden im lokalen Modellmanifest verwaltet.