# llama.cpp und Profile Der produktive Build wird über `LLAMA_CPP_COMMIT` festgeschrieben. Damit ist ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master. ## Build ```text sudo platform/llama/build-llama-cpp.sh ``` Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen. ## Produktive Modelle - Fast: Qwen3.8-27B IQ4-MIX mit MTP2 - Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3 - Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext - Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2 - Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige Projektor liegt vollständig auf der RTX 3060 Die produktive Runtime ist auf llama.cpp Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, festgeschrieben. Im lokalen A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von 56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn auch auf Qwen3.8 anzuwenden. Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet. ## Profilinstallation Die Vorlagen unter `platform/profiles` verwenden Umgebungsvariablen in einer gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides verwendet werden. Der Profilwechsel erfolgt ausschließlich über `platform/scripts/llama-profile`.