43 lines
1.7 KiB
Markdown
43 lines
1.7 KiB
Markdown
# llama.cpp und Profile
|
|
|
|
Der produktive Build wird über `LLAMA_CPP_COMMIT` festgeschrieben. Damit ist
|
|
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
|
|
|
|
## Build
|
|
|
|
```text
|
|
sudo platform/llama/build-llama-cpp.sh
|
|
```
|
|
|
|
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst
|
|
nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
|
|
|
|
## Produktive Modelle
|
|
|
|
- Fast: Qwen3.8-27B IQ4-MIX mit MTP2
|
|
- Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
|
|
- Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext
|
|
- Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
|
|
- Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige
|
|
Projektor liegt vollständig auf der RTX 3060
|
|
|
|
Die produktive Runtime ist auf llama.cpp Build 10718, Commit
|
|
`41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, festgeschrieben. Im lokalen
|
|
A/B-Test blieben normaler Durchsatz, 70K-/120K-Kontext und Prompt-Cache
|
|
unverändert. Mit 100 angebotenen Werkzeugen stieg der Ausgabedurchsatz von
|
|
56,03 auf 60,67 Tokens/s. Der Build begrenzt insbesondere einen teuren
|
|
Qwen3-Coder-Workaround wieder auf die betroffenen Modellfamilien, statt ihn
|
|
auch auf Qwen3.8 anzuwenden.
|
|
|
|
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes
|
|
werden im lokalen Modellmanifest verwaltet.
|
|
|
|
## Profilinstallation
|
|
|
|
Die Vorlagen unter `platform/profiles` verwenden Umgebungsvariablen in einer
|
|
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
|
|
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
|
|
verwendet werden.
|
|
|
|
Der Profilwechsel erfolgt ausschließlich über `platform/scripts/llama-profile`.
|