# llama.cpp und Profile Der produktive Build wird über `LLAMA_CPP_COMMIT` festgeschrieben. Damit ist ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master. ## Build ```text sudo platform/llama/build-llama-cpp.sh ``` Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen. ## Produktive Modelle - Fast: Qwen3.8-27B IQ4-MIX mit MTP2 - Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3 - Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext - Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2 - Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige Projektor liegt vollständig auf der RTX 3060 Die produktive Runtime ist seit dem 12. September 2026 auf llama.cpp **Build 10930**, Commit `56381e407c0ccfb3a6f71e668a27a901001d22ce`, festgeschrieben. Enthalten ist der am 11. September integrierte Fix [„speculation after an image“ (#28715)](https://github.com/ggml-org/llama.cpp/pull/28715). Er korrigiert die Positionsübergabe an den Drafter nach Bildeingaben und ist nicht mit einer generellen Behebung aller MMProj-/Prompt-Cache-Probleme gleichzusetzen. Der unmittelbar vorher laufende Build war **10872**, Commit `b31b71f3a076bfc4278daad442203a9c51c6e676`; die frühere Angabe 10781 war im Live-System bereits überholt. Das unveränderte Rückfallimage heißt `mike-ai/llama.cpp:b10872-pre-b10930`. Build, Tests und Wiederherstellung sind in [docs/LLAMA_B10930_UPDATE_20260912.md](../../docs/LLAMA_B10930_UPDATE_20260912.md) dokumentiert. Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet. ## Profilinstallation Die Vorlagen unter `platform/profiles` verwenden Umgebungsvariablen in einer gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides verwendet werden. Der Profilwechsel erfolgt ausschließlich über `platform/scripts/llama-profile`. Die produktiven Batch- und Micro-Batch-Werte samt Messungen stehen in [docs/PREFILL_BATCH_TUNING_20260915.md](../../docs/PREFILL_BATCH_TUNING_20260915.md).