Document complete recovery requirements and reference state
This commit is contained in:
@@ -0,0 +1,163 @@
|
||||
# Aktueller produktiver Referenzstand
|
||||
|
||||
Stand: 20. August 2026. Dieses Dokument beschreibt die funktionierende
|
||||
Referenz vor dem geplanten Neuaufbau. Es ist keine Empfehlung, jede Altlast des
|
||||
Hosts zu übernehmen.
|
||||
|
||||
## Hardware und Betriebssystem
|
||||
|
||||
| Bereich | Referenz |
|
||||
|---|---|
|
||||
| Betriebssystem | Debian 13 `trixie` |
|
||||
| Kernel | 6.12.101+deb13-amd64 |
|
||||
| CPU | AMD Ryzen 5 5600, 6 Kerne/12 Threads |
|
||||
| RAM | 48 GiB DDR4-2666 |
|
||||
| GPU | NVIDIA GeForce RTX 5080, 16 GiB VRAM |
|
||||
| NVIDIA-Treiber | 610.57.04 |
|
||||
| System-SSD | Samsung 980 PRO 1 TB |
|
||||
| Daten-SSD | Samsung 980 PRO 2 TB |
|
||||
|
||||
Die früher verwendete Radeon RX 470 ist ausgebaut und gehört nicht zur
|
||||
Zielplattform.
|
||||
|
||||
## Produktiver Text-Stack
|
||||
|
||||
| Eigenschaft | Aktueller Wert |
|
||||
|---|---|
|
||||
| Runtime | llama.cpp |
|
||||
| Repository | `https://github.com/ggml-org/llama.cpp.git` |
|
||||
| Commit | `4df29be4f4c3673f428170fda944a5b19f743bb8` |
|
||||
| Compiler | GCC 14.2 |
|
||||
| Hauptdienst | `mike-ai-llama-ui.service` |
|
||||
| llama.cpp-Port | 8080, auf dem alten Host noch im LAN gebunden |
|
||||
| Client-Port | 8081 über den Router |
|
||||
| MCP-Konfiguration | `/etc/mike-ai/mcp-servers.json` |
|
||||
|
||||
### Aktives Fast-Profil
|
||||
|
||||
- Qwen3.8-27B IQ4-MIX
|
||||
- Kontext 73.728
|
||||
- vollständig auf CUDA0
|
||||
- Flash Attention
|
||||
- KV-Cache Q4_0 für K und V
|
||||
- MTP Draft, maximal zwei Tokens
|
||||
- sechs Threads und sechs Batch-Threads
|
||||
- Batch 64, Micro-Batch 32
|
||||
- ein paralleler Slot
|
||||
- Jinja und automatisches Reasoning
|
||||
- Temperatur 0,2, Top-p 0,8, Top-k 20
|
||||
|
||||
### Profile
|
||||
|
||||
| Profil | Virtuelles Modell | Kontext | Besonderheit |
|
||||
|---|---|---:|---|
|
||||
| Fast | `qwen-fast` | 73.728 | IQ4-MIX, MTP2, vollständig GPU |
|
||||
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP |
|
||||
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN-Blöcke 0–11 auf CPU |
|
||||
|
||||
## Router
|
||||
|
||||
- Dienst: `mike-ai-profile-router.service`
|
||||
- Port: 8081
|
||||
- Upstream: `127.0.0.1:8080`
|
||||
- Commit des Plattform-Repositories: siehe jeweils aktuelles `main`
|
||||
- Umschaltskript: `/usr/local/bin/llama-profile`
|
||||
- Timeout für Profilwechsel und Requests: 600 Sekunden
|
||||
|
||||
Der Router übernimmt:
|
||||
|
||||
- OpenAI-kompatibles Chat-Proxying und Streaming
|
||||
- virtuelle Modelle und automatische Profilumschaltung
|
||||
- Tool Calls
|
||||
- Vision-Hotswap mit Cache für Folgefragen
|
||||
- FLUX-Hotswap zur Bildgenerierung
|
||||
- Whisper Speech-to-Text
|
||||
- XTTS Text-to-Speech
|
||||
- Zustands- und Modellendpunkte
|
||||
|
||||
## Vision
|
||||
|
||||
| Bereich | Referenz |
|
||||
|---|---|
|
||||
| Text-/Visionmodell | Qwen3.8-27B Q3_K_M |
|
||||
| Projektor | BF16-mmproj |
|
||||
| Kontext | 32.768 |
|
||||
| temporärer Port | 8086 |
|
||||
| maximale Ausgabe | 4.096 Tokens |
|
||||
|
||||
Vision wird nicht dauerhaft parallel geladen. Der Router entlädt das
|
||||
Textprofil, analysiert das Bild und stellt danach das ursprüngliche Profil
|
||||
wieder her.
|
||||
|
||||
## Bildgenerierung
|
||||
|
||||
- Modell: FLUX.2 klein Base 4B
|
||||
- Runtime: PyTorch/Diffusers
|
||||
- CPU-Offload aktiviert
|
||||
- Standard: 30 Schritte
|
||||
- High: 50 Schritte
|
||||
- Worker wird nach jedem Job vollständig beendet
|
||||
- Qwen wird anschließend mit dem vorherigen Profil wiederhergestellt
|
||||
|
||||
## Sprache
|
||||
|
||||
### Whisper
|
||||
|
||||
- Modell: large-v3-turbo
|
||||
- lokale Standardsprache: Deutsch
|
||||
- CPU-Ausführung
|
||||
- acht Threads im produktiven Worker
|
||||
- Port 8084, nur localhost
|
||||
- ffmpeg für Eingabeumwandlung
|
||||
|
||||
### XTTS
|
||||
|
||||
- Modell: Coqui XTTS-v2
|
||||
- CPU-only
|
||||
- Stimme: `claribel`
|
||||
- Deutsch und Englisch
|
||||
- Port 8085, auf dem alten Host noch im LAN gebunden
|
||||
- eigenes Python-3.11-Venv
|
||||
|
||||
## Websuche
|
||||
|
||||
- Docker Compose
|
||||
- SearXNG, per Digest gepinnt
|
||||
- TinySearch 0.5.1, per Digest gepinnt
|
||||
- TinySearch nur auf `127.0.0.1:8000`
|
||||
- lokale ONNX-Embeddings
|
||||
- kompakte Web-MCP-Fassade mit vier Werkzeugen
|
||||
- strukturierte API-Pfade für GitHub und Hugging Face
|
||||
|
||||
## MCP-Referenz
|
||||
|
||||
Aktuell existieren funktionale Adapter für:
|
||||
|
||||
- Websuche
|
||||
- Home Assistant
|
||||
- Sonarr/Radarr
|
||||
- Unraid read-only
|
||||
- eigener Unraid-Administrationsserver
|
||||
|
||||
Der frühere allgemeine Shell-MCP und doppelte, schreibende Werkzeuge gehören
|
||||
nicht zum Sicherheitsziel und werden nicht ungeprüft wiederhergestellt.
|
||||
|
||||
## Bekannte Probleme des alten Hosts
|
||||
|
||||
- Systempartition vollständig gefüllt
|
||||
- Datenpartition nahezu vollständig gefüllt
|
||||
- etwa 1,27 TB Modelle, darunter Duplikate
|
||||
- mehrere alte llama.cpp-Builds
|
||||
- RX-Dienste trotz ausgebauter Karte
|
||||
- aktivierte Benchmark-/Race-Dienste
|
||||
- alte systemd-Overrides und Sicherungskopien
|
||||
- unvollständiger großer Modelldownload
|
||||
- zu viele MCP-Werkzeuge gleichzeitig im Kontext
|
||||
|
||||
Diese Punkte erklären den Neuaufbau, sind aber keine Bestandteile der neuen
|
||||
Plattform.
|
||||
|
||||
Zusätzliche bekannte Sicherheitsabweichung: llama.cpp auf Port 8080 und XTTS
|
||||
auf Port 8085 sind im alten Zustand breiter gebunden als im Zielsystem. Beim
|
||||
Neuaufbau werden beide auf localhost begrenzt; Clients verwenden ausschließlich
|
||||
den Router auf Port 8081.
|
||||
Reference in New Issue
Block a user