From b0ecc834622c2ea754b7e64565f5bb821d16968a Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Thu, 3 Sep 2026 12:09:10 +0200 Subject: [PATCH] Update llama.cpp to build 10781 --- docs/CURRENT_RUNTIME_NOTES.md | 14 ++++++++------ platform/llama/LLAMA_CPP_COMMIT | 2 +- platform/llama/README.md | 12 +++++------- 3 files changed, 14 insertions(+), 14 deletions(-) diff --git a/docs/CURRENT_RUNTIME_NOTES.md b/docs/CURRENT_RUNTIME_NOTES.md index 588864d..0be7498 100644 --- a/docs/CURRENT_RUNTIME_NOTES.md +++ b/docs/CURRENT_RUNTIME_NOTES.md @@ -1,14 +1,16 @@ # Aktueller produktiver Laufzustand -Stand: 1. September 2026 +Stand: 3. September 2026 ## Produktive llama.cpp-Runtime -Alle Textprofile verwenden llama.cpp Build 10718, -Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587 -wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den -Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest -eine Regression zu zeigen. +Alle Textprofile verwenden llama.cpp Build 10781, +Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab +Build 10751 verfügbare Korrektur für eine zwischenzeitliche +MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war +Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, und bleibt über das alte +lokale Image als unmittelbarer Rückfallpunkt erhalten, bis Build 10781 mit +Qwen, MTP, Vision und langem Kontext verifiziert ist. ## Qwen Medium: Vision-Projektor wieder aktiviert diff --git a/platform/llama/LLAMA_CPP_COMMIT b/platform/llama/LLAMA_CPP_COMMIT index 566c641..b802600 100644 --- a/platform/llama/LLAMA_CPP_COMMIT +++ b/platform/llama/LLAMA_CPP_COMMIT @@ -1 +1 @@ -41ef91f7c8046087cdfbb276b79bff311ecf1c6d +c7bda030e7faee594dbe7550185e857351ad405d diff --git a/platform/llama/README.md b/platform/llama/README.md index fa60ed4..414d84a 100644 --- a/platform/llama/README.md +++ b/platform/llama/README.md @@ -21,13 +21,11 @@ nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen. - Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige Projektor liegt vollständig auf der RTX 3060 -Die produktive Runtime ist auf llama.cpp Build 10718, Commit -`41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, festgeschrieben. Im lokalen -A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache -unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von -56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren -Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn -auch auf Qwen3.8 anzuwenden. +Die produktive Runtime ist auf llama.cpp Build 10781, Commit +`c7bda030e7faee594dbe7550185e857351ad405d`, festgeschrieben. Dieser Stand +enthält die ab Build 10751 verfügbare Korrektur für eine zwischenzeitliche +MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war +Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.