Update llama runtime and isolate background reviews
This commit is contained in:
1 parent
7e36f1dbb7
commit
211ede9fc5
7 files changed
+211
-28
No files matched your search
@@ -21,11 +21,13 @@ nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
|
||||
- Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige
|
||||
Projektor liegt vollständig auf der RTX 3060
|
||||
|
||||
Die produktive Runtime ist auf Commit
|
||||
`3f545beccee69d9975f466ec7e45fd9aacd8ba90` festgeschrieben. Gegen den
|
||||
vorherigen Commit waren Antworten und Geschwindigkeit praktisch identisch;
|
||||
übernommen wurde er wegen der Qwen-/MTP-/Multimodal-Korrekturen und des
|
||||
expliziten `--mmproj-device`.
|
||||
Die produktive Runtime ist auf llama.cpp Build 10718, Commit
|
||||
`41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, festgeschrieben. Im lokalen
|
||||
A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache
|
||||
unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von
|
||||
56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren
|
||||
Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn
|
||||
auch auf Qwen3.8 anzuwenden.
|
||||
|
||||
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes
|
||||
werden im lokalen Modellmanifest verwaltet.
|
||||
|
||||
Reference in new issue
Block a user