Files
AI-Profile-Router/platform/llama/README.md
T

41 lines
1.6 KiB
Markdown

# llama.cpp und Profile
Der produktive Build wird über `LLAMA_CPP_COMMIT` festgeschrieben. Damit ist
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
## Build
```text
sudo platform/llama/build-llama-cpp.sh
```
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst
nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
## Produktive Modelle
- Fast: Qwen3.8-27B IQ4-MIX mit MTP2
- Medium und Large: Qwen3.8-27B IQ4_XS Pure mit MTP3
- Ultra: Qwen3.8-27B IQ4_XS Pure mit MTP2 und maximalem Textkontext
- Uncensored: Blackfrost Qwen3.8-27B Abliterated Q4_K_M mit MTP2
- Fast, Medium, Large und Uncensored: integrierte Vision; der jeweilige
Projektor liegt vollständig auf der RTX 3060
Die produktive Runtime ist auf llama.cpp Build 10781, Commit
`c7bda030e7faee594dbe7550185e857351ad405d`, festgeschrieben. Dieser Stand
enthält die ab Build 10751 verfügbare Korrektur für eine zwischenzeitliche
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`.
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes
werden im lokalen Modellmanifest verwaltet.
## Profilinstallation
Die Vorlagen unter `platform/profiles` verwenden Umgebungsvariablen in einer
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
verwendet werden.
Der Profilwechsel erfolgt ausschließlich über `platform/scripts/llama-profile`.