1.5 KiB
llama.cpp und Profile
Der produktive Build wird über LLAMA_CPP_COMMIT festgeschrieben. Damit ist
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
Build
sudo platform/llama/build-llama-cpp.sh
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
Produktive Modelle
- Fast: Qwen3.8-27B IQ4-MIX mit MTP2
- Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
- Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext
- Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
- Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige Projektor liegt vollständig auf der RTX 3060
Die produktive Runtime ist auf Commit
3f545beccee69d9975f466ec7e45fd9aacd8ba90 festgeschrieben. Gegen den
vorherigen Commit waren Antworten und Geschwindigkeit praktisch identisch;
übernommen wurde er wegen der Qwen-/MTP-/Multimodal-Korrekturen und des
expliziten --mmproj-device.
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.
Profilinstallation
Die Vorlagen unter platform/profiles verwenden Umgebungsvariablen in einer
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
verwendet werden.
Der Profilwechsel erfolgt ausschließlich über platform/scripts/llama-profile.