Files
AI-Profile-Router/docs/OPERATIONS.md
T

1.8 KiB

Betrieb

Profile

Profil Virtuelles Modell Kontext Zweck
Fast qwen-fast 73.728 Alltag, Agenten, hohe Geschwindigkeit
Medium qwen-medium 94.208 mehr Kontext, reine IQ4_XS-Variante
Long qwen-long 131.072 lange Hermes-/MCP-Sitzungen

Manuell wird mit llama-profile fast|medium|long gewechselt. Über HTTP stehen POST /fast, /medium und /long zur Verfügung. Für eine spätere Version ist large als Alias für long vorgesehen; bestehende Namen bleiben kompatibel.

Clients

Clients verbinden sich mit:

http://HOST:8081/v1

Sie sollen nicht direkt Port 8080 verwenden, weil sie sonst Profilumschaltung, Vision, Bildgenerierung, STT und TTS umgehen.

Status

  • GET /status: Router, Profil, Upstream, aktive Jobs
  • GET /v1/models: virtuelle Modelle
  • llama.cpp-Metriken: Port 8080, nur im administrativen Netz freigeben
  • systemd-Journal: nur Metadaten und Fehler prüfen; keine Promptinhalte sammeln

Upgrade-Regel

Niemals Build, Quantisierung und Profil gleichzeitig ändern. Immer genau eine Variable ändern und anschließend denselben Benchmark ausführen.

Kapazitätsregeln

  • Systempartition dauerhaft unter 85 Prozent halten.
  • Mindestens 1 GiB Sicherheitsreserve für allgemeine GPU-Profile vorsehen; experimentelle Max-GPU-Profile klar kennzeichnen.
  • Nur ein Textmodell gleichzeitig laden.
  • Benchmarks sind deaktivierte, manuell gestartete Jobs und keine Boot-Dienste.

Backup

Gesichert werden:

  • dieses Repository,
  • lokale Modellmanifest-Datei mit Hashes, aber ohne Secrets,
  • /etc/mike-ai verschlüsselt,
  • systemd-Konfiguration,
  • Benchmarkresultate.

Nicht gesichert werden müssen Build-Verzeichnisse, Venvs, Caches oder Modelle, wenn Downloadquelle und Prüfsumme dokumentiert sind.