1.8 KiB
1.8 KiB
Betrieb
Profile
| Profil | Virtuelles Modell | Kontext | Zweck |
|---|---|---|---|
| Fast | qwen-fast |
73.728 | Alltag, Agenten, hohe Geschwindigkeit |
| Medium | qwen-medium |
94.208 | mehr Kontext, reine IQ4_XS-Variante |
| Long | qwen-long |
131.072 | lange Hermes-/MCP-Sitzungen |
Manuell wird mit llama-profile fast|medium|long gewechselt. Über HTTP stehen
POST /fast, /medium und /long zur Verfügung. Für eine spätere Version ist
large als Alias für long vorgesehen; bestehende Namen bleiben kompatibel.
Clients
Clients verbinden sich mit:
http://HOST:8081/v1
Sie sollen nicht direkt Port 8080 verwenden, weil sie sonst Profilumschaltung, Vision, Bildgenerierung, STT und TTS umgehen.
Status
GET /status: Router, Profil, Upstream, aktive JobsGET /v1/models: virtuelle Modelle- llama.cpp-Metriken: Port 8080, nur im administrativen Netz freigeben
- systemd-Journal: nur Metadaten und Fehler prüfen; keine Promptinhalte sammeln
Upgrade-Regel
Niemals Build, Quantisierung und Profil gleichzeitig ändern. Immer genau eine Variable ändern und anschließend denselben Benchmark ausführen.
Kapazitätsregeln
- Systempartition dauerhaft unter 85 Prozent halten.
- Mindestens 1 GiB Sicherheitsreserve für allgemeine GPU-Profile vorsehen; experimentelle Max-GPU-Profile klar kennzeichnen.
- Nur ein Textmodell gleichzeitig laden.
- Benchmarks sind deaktivierte, manuell gestartete Jobs und keine Boot-Dienste.
Backup
Gesichert werden:
- dieses Repository,
- lokale Modellmanifest-Datei mit Hashes, aber ohne Secrets,
/etc/mike-aiverschlüsselt,- systemd-Konfiguration,
- Benchmarkresultate.
Nicht gesichert werden müssen Build-Verzeichnisse, Venvs, Caches oder Modelle, wenn Downloadquelle und Prüfsumme dokumentiert sind.