1.7 KiB
llama.cpp und Profile
Der produktive Build wird über LLAMA_CPP_COMMIT festgeschrieben. Damit ist
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
Build
sudo platform/llama/build-llama-cpp.sh
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
Produktive Modelle
- Fast: Qwen3.8-27B IQ4-MIX mit MTP2
- Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
- Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext
- Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
- Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige Projektor liegt vollständig auf der RTX 3060
Die produktive Runtime ist auf llama.cpp Build 10718, Commit
41ef91f7c8046087cdfbb276b79bff311ecf1c6d, festgeschrieben. Im lokalen
A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache
unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von
56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren
Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn
auch auf Qwen3.8 anzuwenden.
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.
Profilinstallation
Die Vorlagen unter platform/profiles verwenden Umgebungsvariablen in einer
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
verwendet werden.
Der Profilwechsel erfolgt ausschließlich über platform/scripts/llama-profile.