# Aktueller produktiver Referenzstand Stand: 20. August 2026. Dieses Dokument beschreibt die funktionierende Referenz vor dem geplanten Neuaufbau. Es ist keine Empfehlung, jede Altlast des Hosts zu übernehmen. ## Hardware und Betriebssystem | Bereich | Referenz | |---|---| | Betriebssystem | Debian 13 `trixie` | | Kernel | 6.12.101+deb13-amd64 | | CPU | AMD Ryzen 5 5600, 6 Kerne/12 Threads | | RAM | 48 GiB DDR4-2666 | | GPU | NVIDIA GeForce RTX 5080, 16 GiB VRAM | | NVIDIA-Treiber | 610.57.04 | | System-SSD | Samsung 980 PRO 1 TB | | Daten-SSD | Samsung 980 PRO 2 TB | Die früher verwendete Radeon RX 470 ist ausgebaut und gehört nicht zur Zielplattform. ## Produktiver Text-Stack | Eigenschaft | Aktueller Wert | |---|---| | Runtime | llama.cpp | | Repository | `https://github.com/ggml-org/llama.cpp.git` | | Commit | `4df29be4f4c3673f428170fda944a5b19f743bb8` | | Compiler | GCC 14.2 | | Hauptdienst | `mike-ai-llama-ui.service` | | llama.cpp-Port | 8080, auf dem alten Host noch im LAN gebunden | | Client-Port | 8081 über den Router | | MCP-Konfiguration | `/etc/mike-ai/mcp-servers.json` | ### Aktives Fast-Profil - Qwen3.8-27B IQ4-MIX - Kontext 73.728 - vollständig auf CUDA0 - Flash Attention - KV-Cache Q4_0 für K und V - MTP Draft, maximal zwei Tokens - sechs Threads und sechs Batch-Threads - Batch 64, Micro-Batch 32 - ein paralleler Slot - Jinja und automatisches Reasoning - Temperatur 0,2, Top-p 0,8, Top-k 20 ### Profile | Profil | Virtuelles Modell | Kontext | Besonderheit | |---|---|---:|---| | Fast | `qwen-fast` | 73.728 | IQ4-MIX, MTP2, vollständig GPU | | Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP | | Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN-Blöcke 0–11 auf CPU | ## Router - Dienst: `mike-ai-profile-router.service` - Port: 8081 - Upstream: `127.0.0.1:8080` - Commit des Plattform-Repositories: siehe jeweils aktuelles `main` - Umschaltskript: `/usr/local/bin/llama-profile` - Timeout für Profilwechsel und Requests: 600 Sekunden Der Router übernimmt: - OpenAI-kompatibles Chat-Proxying und Streaming - virtuelle Modelle und automatische Profilumschaltung - Tool Calls - Vision-Hotswap mit Cache für Folgefragen - FLUX-Hotswap zur Bildgenerierung - Whisper Speech-to-Text - XTTS Text-to-Speech - Zustands- und Modellendpunkte ## Vision | Bereich | Referenz | |---|---| | Text-/Visionmodell | Qwen3.8-27B Q3_K_M | | Projektor | BF16-mmproj | | Kontext | 32.768 | | temporärer Port | 8086 | | maximale Ausgabe | 4.096 Tokens | Vision wird nicht dauerhaft parallel geladen. Der Router entlädt das Textprofil, analysiert das Bild und stellt danach das ursprüngliche Profil wieder her. ## Bildgenerierung - Modell: FLUX.2 klein Base 4B - Runtime: PyTorch/Diffusers - CPU-Offload aktiviert - Standard: 30 Schritte - High: 50 Schritte - Worker wird nach jedem Job vollständig beendet - Qwen wird anschließend mit dem vorherigen Profil wiederhergestellt ## Sprache ### Whisper - Modell: large-v3-turbo - lokale Standardsprache: Deutsch - CPU-Ausführung - acht Threads im produktiven Worker - Port 8084, nur localhost - ffmpeg für Eingabeumwandlung ### XTTS - Modell: Coqui XTTS-v2 - CPU-only - Stimme: `claribel` - Deutsch und Englisch - Port 8085, auf dem alten Host noch im LAN gebunden - eigenes Python-3.11-Venv ## Websuche - Docker Compose - SearXNG, per Digest gepinnt - TinySearch 0.5.1, per Digest gepinnt - TinySearch nur auf `127.0.0.1:8000` - lokale ONNX-Embeddings - kompakte Web-MCP-Fassade mit vier Werkzeugen - strukturierte API-Pfade für GitHub und Hugging Face ## MCP-Referenz Aktuell existieren funktionale Adapter für: - Websuche - Home Assistant - Sonarr/Radarr - Unraid read-only - eigener Unraid-Administrationsserver Der frühere allgemeine Shell-MCP und doppelte, schreibende Werkzeuge gehören nicht zum Sicherheitsziel und werden nicht ungeprüft wiederhergestellt. ## Bekannte Probleme des alten Hosts - Systempartition vollständig gefüllt - Datenpartition nahezu vollständig gefüllt - etwa 1,27 TB Modelle, darunter Duplikate - mehrere alte llama.cpp-Builds - RX-Dienste trotz ausgebauter Karte - aktivierte Benchmark-/Race-Dienste - alte systemd-Overrides und Sicherungskopien - unvollständiger großer Modelldownload - zu viele MCP-Werkzeuge gleichzeitig im Kontext Diese Punkte erklären den Neuaufbau, sind aber keine Bestandteile der neuen Plattform. Zusätzliche bekannte Sicherheitsabweichung: llama.cpp auf Port 8080 und XTTS auf Port 8085 sind im alten Zustand breiter gebunden als im Zielsystem. Beim Neuaufbau werden beide auf localhost begrenzt; Clients verwenden ausschließlich den Router auf Port 8081.