llama.cpp und Profile
Der produktive Build wird über LLAMA_CPP_COMMIT festgeschrieben. Damit ist
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
Build
sudo platform/llama/build-llama-cpp.sh
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
Produktive Modelle
- Fast: Qwen3.8-27B IQ4-MIX mit MTP2
- Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
- Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2, maximalem Kontext und Vision-Projektor auf CPU
- Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
- Alle fünf Profile: integrierte Vision. Bei Fast, Medium, Large und Uncensored liegt der Projektor auf der RTX 3060; bei Ultra auf der CPU.
Die produktive Runtime ist seit dem 12. September 2026 auf llama.cpp
Build 10930, Commit 56381e407c0ccfb3a6f71e668a27a901001d22ce,
festgeschrieben. Enthalten ist der am 11. September integrierte Fix
„speculation after an image“ (#28715).
Er korrigiert die Positionsübergabe an den Drafter nach Bildeingaben und ist
nicht mit einer generellen Behebung aller MMProj-/Prompt-Cache-Probleme
gleichzusetzen.
Der unmittelbar vorher laufende Build war 10872, Commit
b31b71f3a076bfc4278daad442203a9c51c6e676; die frühere Angabe 10781
war im Live-System bereits überholt. Das unveränderte Rückfallimage heißt
mike-ai/llama.cpp:b10872-pre-b10930.
Build, Tests und Wiederherstellung sind in docs/LLAMA_B10930_UPDATE_20260912.md dokumentiert.
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.
Profilinstallation
Die Vorlagen unter platform/profiles verwenden Umgebungsvariablen in einer
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
verwendet werden.
Der Profilwechsel erfolgt ausschließlich über platform/scripts/llama-profile.
Die produktiven Batch- und Micro-Batch-Werte samt Messungen stehen in docs/PREFILL_BATCH_TUNING_20260915.md.