Expand router into reproducible local AI platform
This commit is contained in:
@@ -0,0 +1,31 @@
|
||||
# llama.cpp und Profile
|
||||
|
||||
Der produktive Build wird über `LLAMA_CPP_COMMIT` festgeschrieben. Damit ist
|
||||
ein Neuaufbau unabhängig vom jeweils aktuellen Stand des Upstream-Master.
|
||||
|
||||
## Build
|
||||
|
||||
```text
|
||||
sudo platform/llama/build-llama-cpp.sh
|
||||
```
|
||||
|
||||
Der Build aktiviert CUDA und den HTTP-Server. Änderungen am Commit werden erst
|
||||
nach Standardbenchmark, Tool-Calling-Test und Kontexttest übernommen.
|
||||
|
||||
## Produktive Modelle
|
||||
|
||||
- Fast und Long: Qwen3.8-27B IQ4-MIX mit MTP2
|
||||
- Medium: Qwen3.8-27B IQ4_XS Pure ohne MTP
|
||||
- Vision-Hotswap: Qwen3.8-27B Q3_K_M plus BF16-mmproj
|
||||
|
||||
Die Dateien selbst sind nicht Bestandteil des Repositories. Pfade und Hashes
|
||||
werden im lokalen Modellmanifest verwaltet.
|
||||
|
||||
## Profilinstallation
|
||||
|
||||
Die Vorlagen unter `platform/profiles` verwenden Umgebungsvariablen in einer
|
||||
gemeinsamen Environment-Datei. Für die aktuelle produktive Installation können
|
||||
sie alternativ als dokumentierte Referenz für vollständige systemd-Overrides
|
||||
verwendet werden.
|
||||
|
||||
Der Profilwechsel erfolgt ausschließlich über `platform/scripts/llama-profile`.
|
||||
Reference in New Issue
Block a user