Files

2.2 KiB

llama.cpp und Profile

Der produktive Build wird über LLAMA_CPP_COMMIT festgeschrieben. Damit ist ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.

Build

sudo platform/llama/build-llama-cpp.sh

Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.

Produktive Modelle

  • Fast: Qwen3.8-27B IQ4-MIX mit MTP2
  • Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
  • Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2, maximalem Kontext und Vision-Projektor auf CPU
  • Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
  • Alle fünf Profile: integrierte Vision. Bei Fast, Medium, Large und Uncensored liegt der Projektor auf der RTX 3060; bei Ultra auf der CPU.

Die produktive Runtime ist seit dem 12. September 2026 auf llama.cpp Build 10930, Commit 56381e407c0ccfb3a6f71e668a27a901001d22ce, festgeschrieben. Enthalten ist der am 11. September integrierte Fix „speculation after an image“ (#28715). Er korrigiert die Positionsübergabe an den Drafter nach Bildeingaben und ist nicht mit einer generellen Behebung aller MMProj-/Prompt-Cache-Probleme gleichzusetzen.

Der unmittelbar vorher laufende Build war 10872, Commit b31b71f3a076bfc4278daad442203a9c51c6e676; die frühere Angabe 10781 war im Live-System bereits überholt. Das unveränderte Rückfallimage heißt mike-ai/llama.cpp:b10872-pre-b10930.

Build, Tests und Wiederherstellung sind in docs/LLAMA_B10930_UPDATE_20260912.md dokumentiert.

Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes werden im lokalen Modellmanifest verwaltet.

Profilinstallation

Die Vorlagen unter platform/profiles verwenden Umgebungsvariablen in einer gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides verwendet werden.

Der Profilwechsel erfolgt ausschließlich über platform/scripts/llama-profile.

Die produktiven Batch- und Micro-Batch-Werte samt Messungen stehen in docs/PREFILL_BATCH_TUNING_20260915.md.