Files
AI-Profile-Router/platform/llama

llama.cpp und Profile

Der produktive Build wird über LLAMA_CPP_COMMIT festgeschrieben. Damit ist ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.

Build

sudo platform/llama/build-llama-cpp.sh

Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.

Produktive Modelle

  • Fast und Long: Qwen3.8-27B IQ4-MIX mit MTP2
  • Medium: Qwen3.8-27B IQ4_XS Pure ohne MTP
  • Alle Profile: integrierte Vision mit demselben BF16-mmproj im System-RAM

Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.

Profilinstallation

Die Vorlagen unter platform/profiles verwenden Umgebungsvariablen in einer gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides verwendet werden.

Der Profilwechsel erfolgt ausschließlich über platform/scripts/llama-profile.