4.6 KiB
Aktueller produktiver Referenzstand
Stand: 20. August 2026. Dieses Dokument beschreibt die funktionierende Referenz vor dem geplanten Neuaufbau. Es ist keine Empfehlung, jede Altlast des Hosts zu übernehmen.
Hardware und Betriebssystem
| Bereich | Referenz |
|---|---|
| Betriebssystem | Debian 13 trixie |
| Kernel | 6.12.101+deb13-amd64 |
| CPU | AMD Ryzen 5 5600, 6 Kerne/12 Threads |
| RAM | 48 GiB DDR4-2666 |
| GPU | NVIDIA GeForce RTX 5080, 16 GiB VRAM |
| NVIDIA-Treiber | 610.57.04 |
| System-SSD | Samsung 980 PRO 1 TB |
| Daten-SSD | Samsung 980 PRO 2 TB |
Die früher verwendete Radeon RX 470 ist ausgebaut und gehört nicht zur Zielplattform.
Produktiver Text-Stack
| Eigenschaft | Aktueller Wert |
|---|---|
| Runtime | llama.cpp |
| Repository | https://github.com/ggml-org/llama.cpp.git |
| Commit | 4df29be4f4c3673f428170fda944a5b19f743bb8 |
| Compiler | GCC 14.2 |
| Hauptdienst | mike-ai-llama-ui.service |
| llama.cpp-Port | 8080, auf dem alten Host noch im LAN gebunden |
| Client-Port | 8081 über den Router |
| MCP-Konfiguration | /etc/mike-ai/mcp-servers.json |
Aktives Fast-Profil
- Qwen3.8-27B IQ4-MIX
- Kontext 76.800
- vollständig auf CUDA0
- Flash Attention
- KV-Cache Q4_0 für K und V
- MTP Draft, maximal zwei Tokens
- sechs Threads und sechs Batch-Threads
- Batch 64, Micro-Batch 32
- ein paralleler Slot
- Jinja und automatisches Reasoning
- Temperatur 0,2, Top-p 0,8, Top-k 20
Profile
| Profil | Virtuelles Modell | Kontext | Besonderheit |
|---|---|---|---|
| Fast | qwen-fast |
76.800 | IQ4-MIX, MTP2, vollständig GPU, CPU-mmproj |
| Medium | qwen-medium |
94.208 | IQ4_XS Pure, ohne MTP, CPU-mmproj |
| Long | qwen-long |
131.072 | IQ4-MIX, MTP2, FFN 0–11 auf CPU, CPU-mmproj |
Router
- Dienst:
mike-ai-profile-router.service - Port: 8081
- Upstream:
127.0.0.1:8080 - Commit des Plattform-Repositories: siehe jeweils aktuelles
main - Umschaltskript:
/usr/local/bin/llama-profile - Timeout für Profilwechsel und Requests: 600 Sekunden
Der Router übernimmt:
- OpenAI-kompatibles Chat-Proxying und Streaming
- virtuelle Modelle und automatische Profilumschaltung
- Tool Calls
- direkte integrierte Vision in allen Qwen-Profilen
- FLUX-Hotswap zur Bildgenerierung
- Whisper Speech-to-Text
- XTTS Text-to-Speech
- Zustands- und Modellendpunkte
Vision
| Bereich | Referenz |
|---|---|
| Text-/Visionmodell | jeweils aktives Qwen3.8-27B-Profil |
| Projektor | BF16-mmproj |
| Speicherort des Projektors | System-RAM (--no-mmproj-offload) |
| Kontext | entspricht Fast/Medium/Long |
Vision ist Bestandteil jedes Profils. Der Router prüft Bildgröße und URL, leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.
Bildgenerierung
- Modell: FLUX.2 klein Base 4B
- Runtime: PyTorch/Diffusers
- CPU-Offload aktiviert
- Standard: 30 Schritte
- High: 50 Schritte
- Worker wird nach jedem Job vollständig beendet
- Qwen wird anschließend mit dem vorherigen Profil wiederhergestellt
Sprache
Whisper
- Modell: large-v3-turbo
- lokale Standardsprache: Deutsch
- CPU-Ausführung
- acht Threads im produktiven Worker
- Port 8084, nur localhost
- ffmpeg für Eingabeumwandlung
XTTS
- Modell: Coqui XTTS-v2
- CPU-only
- Stimme:
claribel - Deutsch und Englisch
- Port 8085, auf dem alten Host noch im LAN gebunden
- eigenes Python-3.11-Venv
Websuche
- Docker Compose
- SearXNG, per Digest gepinnt
- TinySearch 0.5.1, per Digest gepinnt
- TinySearch nur auf
127.0.0.1:8000 - lokale ONNX-Embeddings
- kompakte Web-MCP-Fassade mit vier Werkzeugen
- strukturierte API-Pfade für GitHub und Hugging Face
MCP-Referenz
Aktuell existieren funktionale Adapter für:
- Websuche
- Home Assistant
- Sonarr/Radarr
- Unraid read-only
- eigener Unraid-Administrationsserver
Der frühere allgemeine Shell-MCP und doppelte, schreibende Werkzeuge gehören nicht zum Sicherheitsziel und werden nicht ungeprüft wiederhergestellt.
Bekannte Probleme des alten Hosts
- Systempartition vollständig gefüllt
- Datenpartition nahezu vollständig gefüllt
- etwa 1,27 TB Modelle, darunter Duplikate
- mehrere alte llama.cpp-Builds
- RX-Dienste trotz ausgebauter Karte
- aktivierte Benchmark-/Race-Dienste
- alte systemd-Overrides und Sicherungskopien
- unvollständiger großer Modelldownload
- zu viele MCP-Werkzeuge gleichzeitig im Kontext
Diese Punkte erklären den Neuaufbau, sind aber keine Bestandteile der neuen Plattform.
Zusätzliche bekannte Sicherheitsabweichung: llama.cpp auf Port 8080 und XTTS auf Port 8085 sind im alten Zustand breiter gebunden als im Zielsystem. Beim Neuaufbau werden beide auf localhost begrenzt; Clients verwenden ausschließlich den Router auf Port 8081.