Files
AI-Profile-Router/platform/llama

llama.cpp und Profile

Der produktive Build wird über LLAMA_CPP_COMMIT festgeschrieben. Damit ist ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.

Build

sudo platform/llama/build-llama-cpp.sh

Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.

Produktive Modelle

  • Fast: Qwen3.8-27B IQ4-MIX mit MTP2
  • Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
  • Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext
  • Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
  • Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige Projektor liegt vollständig auf der RTX 3060

Die produktive Runtime ist auf llama.cpp Build 10718, Commit 41ef91f7c8046087cdfbb276b79bff311ecf1c6d, festgeschrieben. Im lokalen A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von 56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn auch auf Qwen3.8 anzuwenden.

Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.

Profilinstallation

Die Vorlagen unter platform/profiles verwenden Umgebungsvariablen in einer gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides verwendet werden.

Der Profilwechsel erfolgt ausschließlich über platform/scripts/llama-profile.