55 lines
2.2 KiB
Markdown
55 lines
2.2 KiB
Markdown
# llama.cpp und Profile
|
|
|
|
Der produktive Build wird über `LLAMA_CPP_COMMIT` festgeschrieben. Damit ist
|
|
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
|
|
|
|
## Build
|
|
|
|
```text
|
|
sudo platform/llama/build-llama-cpp.sh
|
|
```
|
|
|
|
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst
|
|
nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
|
|
|
|
## Produktive Modelle
|
|
|
|
- Fast: Qwen3.8-27B IQ4-MIX mit MTP2
|
|
- Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
|
|
- Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2, maximalem Kontext und Vision-Projektor auf CPU
|
|
- Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
|
|
- Alle fünf Profile: integrierte Vision. Bei Fast, Medium, Large und
|
|
Uncensored liegt der Projektor auf der RTX 3060; bei Ultra auf der CPU.
|
|
|
|
Die produktive Runtime ist seit dem 12. September 2026 auf llama.cpp
|
|
**Build 10930**, Commit `56381e407c0ccfb3a6f71e668a27a901001d22ce`,
|
|
festgeschrieben. Enthalten ist der am 11. September integrierte Fix
|
|
[„speculation after an image“ (#28715)](https://github.com/ggml-org/llama.cpp/pull/28715).
|
|
Er korrigiert die Positionsübergabe an den Drafter nach Bildeingaben und ist
|
|
nicht mit einer generellen Behebung aller MMProj-/Prompt-Cache-Probleme
|
|
gleichzusetzen.
|
|
|
|
Der unmittelbar vorher laufende Build war **10872**, Commit
|
|
`b31b71f3a076bfc4278daad442203a9c51c6e676`; die frühere Angabe 10781
|
|
war im Live-System bereits überholt. Das unveränderte Rückfallimage heißt
|
|
`mike-ai/llama.cpp:b10872-pre-b10930`.
|
|
|
|
Build, Tests und Wiederherstellung sind in
|
|
[docs/LLAMA_B10930_UPDATE_20260912.md](../../docs/LLAMA_B10930_UPDATE_20260912.md)
|
|
dokumentiert.
|
|
|
|
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes
|
|
werden im lokalen Modellmanifest verwaltet.
|
|
|
|
## Profilinstallation
|
|
|
|
Die Vorlagen unter `platform/profiles` verwenden Umgebungsvariablen in einer
|
|
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
|
|
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
|
|
verwendet werden.
|
|
|
|
Der Profilwechsel erfolgt ausschließlich über `platform/scripts/llama-profile`.
|
|
|
|
Die produktiven Batch- und Micro-Batch-Werte samt Messungen stehen in
|
|
[docs/PREFILL_BATCH_TUNING_20260915.md](../../docs/PREFILL_BATCH_TUNING_20260915.md).
|