Files
AI-Profile-Router/docs/CURRENT_REFERENCE.md
T

4.9 KiB
Raw Blame History

Aktueller produktiver Referenzstand

Stand: 20. August 2026. Dieses Dokument beschreibt die funktionierende Referenz vor dem geplanten Neuaufbau. Es ist keine Empfehlung, jede Altlast des Hosts zu übernehmen.

Hardware und Betriebssystem

Bereich Referenz
Betriebssystem Debian 13 trixie
Kernel 6.12.101+deb13-amd64
CPU AMD Ryzen 5 5600, 6 Kerne/12 Threads
RAM 48 GiB DDR4-2666
GPU NVIDIA GeForce RTX 5080, 16 GiB VRAM
NVIDIA-Treiber 610.57.04
System-SSD Samsung 980 PRO 1 TB
Daten-SSD Samsung 980 PRO 2 TB

Die früher verwendete Radeon RX 470 ist ausgebaut und gehört nicht zur Zielplattform.

Produktiver Text-Stack

Eigenschaft Aktueller Wert
Runtime llama.cpp
Repository https://github.com/ggml-org/llama.cpp.git
Commit 4df29be4f4c3673f428170fda944a5b19f743bb8
Compiler GCC 14.2
Hauptdienst mike-ai-llama-ui.service
llama.cpp-Port 8080, auf dem alten Host noch im LAN gebunden
Client-Port 8081 über den Router
MCP-Konfiguration /etc/mike-ai/mcp-servers.json

Aktives Fast-Profil

  • Qwen3.8-27B IQ4-MIX
  • Dateigröße: 14.111.614.400 Bytes
  • SHA256: 54879ae8738d5938f46cb3b8cbf16bf42b8c85b7d68d7c73f062b612ec183e36
  • Öffentliche Herkunft ist noch nicht ausreichend dokumentiert; für eine bitgenaue Migration muss die geprüfte Datei vom Referenzhost gesichert werden.
  • Kontext 76.800
  • vollständig auf CUDA0
  • Flash Attention
  • KV-Cache Q4_0 für K und V
  • MTP Draft, maximal zwei Tokens
  • sechs Threads und sechs Batch-Threads
  • Batch 64, Micro-Batch 32
  • ein paralleler Slot
  • Jinja und automatisches Reasoning
  • Temperatur 0,2, Top-p 0,8, Top-k 20

Profile

Profil Virtuelles Modell Kontext Besonderheit
Fast qwen-fast 76.800 IQ4-MIX, MTP2, vollständig GPU, CPU-mmproj
Medium qwen-medium 94.208 IQ4_XS Pure, ohne MTP, CPU-mmproj
Long qwen-long 131.072 IQ4-MIX, MTP2, FFN 0–11 auf CPU, CPU-mmproj

Router

  • Dienst: mike-ai-profile-router.service
  • Port: 8081
  • Upstream: 127.0.0.1:8080
  • Commit des Plattform-Repositories: siehe jeweils aktuelles main
  • Umschaltskript: /usr/local/bin/llama-profile
  • Timeout für Profilwechsel und Requests: 600 Sekunden

Der Router übernimmt:

  • OpenAI-kompatibles Chat-Proxying und Streaming
  • virtuelle Modelle und automatische Profilumschaltung
  • Tool Calls
  • direkte integrierte Vision in allen Qwen-Profilen
  • FLUX-Hotswap zur Bildgenerierung
  • Whisper Speech-to-Text
  • XTTS Text-to-Speech
  • Zustands- und Modellendpunkte

Vision

Bereich Referenz
Text-/Visionmodell jeweils aktives Qwen3.8-27B-Profil
Projektor BF16-mmproj
Speicherort des Projektors System-RAM (--no-mmproj-offload)
Kontext entspricht Fast/Medium/Long

Vision ist Bestandteil jedes Profils. Der Router prüft Bildgröße und URL, leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.

Bildgenerierung

  • Modell: FLUX.2 klein Base 4B
  • Runtime: PyTorch/Diffusers
  • CPU-Offload aktiviert
  • Standard: 30 Schritte
  • High: 50 Schritte
  • Worker wird nach jedem Job vollständig beendet
  • Qwen wird anschließend mit dem vorherigen Profil wiederhergestellt

Sprache

Whisper

  • Modell: large-v3-turbo
  • lokale Standardsprache: Deutsch
  • CPU-Ausführung
  • acht Threads im produktiven Worker
  • Port 8084, nur localhost
  • ffmpeg für Eingabeumwandlung

XTTS

  • Modell: Coqui XTTS-v2
  • CPU-only
  • Stimme: claribel
  • Deutsch und Englisch
  • Port 8085, auf dem alten Host noch im LAN gebunden
  • eigenes Python-3.11-Venv

Websuche

  • Docker Compose
  • SearXNG, per Digest gepinnt
  • TinySearch 0.5.1, per Digest gepinnt
  • TinySearch nur auf 127.0.0.1:8000
  • lokale ONNX-Embeddings
  • kompakte Web-MCP-Fassade mit vier Werkzeugen
  • strukturierte API-Pfade für GitHub und Hugging Face

MCP-Referenz

Aktuell existieren funktionale Adapter für:

  • Websuche
  • Home Assistant
  • Sonarr/Radarr
  • Unraid read-only
  • eigener Unraid-Administrationsserver

Der frühere allgemeine Shell-MCP und doppelte, schreibende Werkzeuge gehören nicht zum Sicherheitsziel und werden nicht ungeprüft wiederhergestellt.

Bekannte Probleme des alten Hosts

  • Systempartition vollständig gefüllt
  • Datenpartition nahezu vollständig gefüllt
  • etwa 1,27 TB Modelle, darunter Duplikate
  • mehrere alte llama.cpp-Builds
  • RX-Dienste trotz ausgebauter Karte
  • aktivierte Benchmark-/Race-Dienste
  • alte systemd-Overrides und Sicherungskopien
  • unvollständiger großer Modelldownload
  • zu viele MCP-Werkzeuge gleichzeitig im Kontext

Diese Punkte erklären den Neuaufbau, sind aber keine Bestandteile der neuen Plattform.

Zusätzliche bekannte Sicherheitsabweichung: llama.cpp auf Port 8080 und XTTS auf Port 8085 sind im alten Zustand breiter gebunden als im Zielsystem. Beim Neuaufbau werden beide auf localhost begrenzt; Clients verwenden ausschließlich den Router auf Port 8081.