Files
AI-Profile-Router/docs/CURRENT_REFERENCE.md
T

4.5 KiB
Raw Blame History

Aktueller produktiver Referenzstand

Stand: 20. August 2026. Dieses Dokument beschreibt die funktionierende Referenz vor dem geplanten Neuaufbau. Es ist keine Empfehlung, jede Altlast des Hosts zu übernehmen.

Hardware und Betriebssystem

Bereich Referenz
Betriebssystem Debian 13 trixie
Kernel 6.12.101+deb13-amd64
CPU AMD Ryzen 5 5600, 6 Kerne/12 Threads
RAM 48 GiB DDR4-2666
GPU NVIDIA GeForce RTX 5080, 16 GiB VRAM
NVIDIA-Treiber 610.57.04
System-SSD Samsung 980 PRO 1 TB
Daten-SSD Samsung 980 PRO 2 TB

Die früher verwendete Radeon RX 470 ist ausgebaut und gehört nicht zur Zielplattform.

Produktiver Text-Stack

Eigenschaft Aktueller Wert
Runtime llama.cpp
Repository https://github.com/ggml-org/llama.cpp.git
Commit 4df29be4f4c3673f428170fda944a5b19f743bb8
Compiler GCC 14.2
Hauptdienst mike-ai-llama-ui.service
llama.cpp-Port 8080, auf dem alten Host noch im LAN gebunden
Client-Port 8081 über den Router
MCP-Konfiguration /etc/mike-ai/mcp-servers.json

Aktives Fast-Profil

  • Qwen3.8-27B IQ4-MIX
  • Kontext 73.728
  • vollständig auf CUDA0
  • Flash Attention
  • KV-Cache Q4_0 für K und V
  • MTP Draft, maximal zwei Tokens
  • sechs Threads und sechs Batch-Threads
  • Batch 64, Micro-Batch 32
  • ein paralleler Slot
  • Jinja und automatisches Reasoning
  • Temperatur 0,2, Top-p 0,8, Top-k 20

Profile

Profil Virtuelles Modell Kontext Besonderheit
Fast qwen-fast 73.728 IQ4-MIX, MTP2, vollständig GPU
Medium qwen-medium 94.208 IQ4_XS Pure, ohne MTP
Long qwen-long 131.072 IQ4-MIX, MTP2, FFN-Blöcke 0–11 auf CPU

Router

  • Dienst: mike-ai-profile-router.service
  • Port: 8081
  • Upstream: 127.0.0.1:8080
  • Commit des Plattform-Repositories: siehe jeweils aktuelles main
  • Umschaltskript: /usr/local/bin/llama-profile
  • Timeout für Profilwechsel und Requests: 600 Sekunden

Der Router übernimmt:

  • OpenAI-kompatibles Chat-Proxying und Streaming
  • virtuelle Modelle und automatische Profilumschaltung
  • Tool Calls
  • Vision-Hotswap mit Cache für Folgefragen
  • FLUX-Hotswap zur Bildgenerierung
  • Whisper Speech-to-Text
  • XTTS Text-to-Speech
  • Zustands- und Modellendpunkte

Vision

Bereich Referenz
Text-/Visionmodell Qwen3.8-27B Q3_K_M
Projektor BF16-mmproj
Kontext 32.768
temporärer Port 8086
maximale Ausgabe 4.096 Tokens

Vision wird nicht dauerhaft parallel geladen. Der Router entlädt das Textprofil, analysiert das Bild und stellt danach das ursprüngliche Profil wieder her.

Bildgenerierung

  • Modell: FLUX.2 klein Base 4B
  • Runtime: PyTorch/Diffusers
  • CPU-Offload aktiviert
  • Standard: 30 Schritte
  • High: 50 Schritte
  • Worker wird nach jedem Job vollständig beendet
  • Qwen wird anschließend mit dem vorherigen Profil wiederhergestellt

Sprache

Whisper

  • Modell: large-v3-turbo
  • lokale Standardsprache: Deutsch
  • CPU-Ausführung
  • acht Threads im produktiven Worker
  • Port 8084, nur localhost
  • ffmpeg für Eingabeumwandlung

XTTS

  • Modell: Coqui XTTS-v2
  • CPU-only
  • Stimme: claribel
  • Deutsch und Englisch
  • Port 8085, auf dem alten Host noch im LAN gebunden
  • eigenes Python-3.11-Venv

Websuche

  • Docker Compose
  • SearXNG, per Digest gepinnt
  • TinySearch 0.5.1, per Digest gepinnt
  • TinySearch nur auf 127.0.0.1:8000
  • lokale ONNX-Embeddings
  • kompakte Web-MCP-Fassade mit vier Werkzeugen
  • strukturierte API-Pfade für GitHub und Hugging Face

MCP-Referenz

Aktuell existieren funktionale Adapter für:

  • Websuche
  • Home Assistant
  • Sonarr/Radarr
  • Unraid read-only
  • eigener Unraid-Administrationsserver

Der frühere allgemeine Shell-MCP und doppelte, schreibende Werkzeuge gehören nicht zum Sicherheitsziel und werden nicht ungeprüft wiederhergestellt.

Bekannte Probleme des alten Hosts

  • Systempartition vollständig gefüllt
  • Datenpartition nahezu vollständig gefüllt
  • etwa 1,27 TB Modelle, darunter Duplikate
  • mehrere alte llama.cpp-Builds
  • RX-Dienste trotz ausgebauter Karte
  • aktivierte Benchmark-/Race-Dienste
  • alte systemd-Overrides und Sicherungskopien
  • unvollständiger großer Modelldownload
  • zu viele MCP-Werkzeuge gleichzeitig im Kontext

Diese Punkte erklären den Neuaufbau, sind aber keine Bestandteile der neuen Plattform.

Zusätzliche bekannte Sicherheitsabweichung: llama.cpp auf Port 8080 und XTTS auf Port 8085 sind im alten Zustand breiter gebunden als im Zielsystem. Beim Neuaufbau werden beide auf localhost begrenzt; Clients verwenden ausschließlich den Router auf Port 8081.