2.6 KiB
Aktuelle Architektur
flowchart LR
C[Hermes Desktop / Web / Mobil] --> H[Hermes Agent<br/>Unraid]
OC[OpenClaw Web / Mac<br/>Unraid-Gateway] -->|OpenAI API| R
OC --> V[Athena-Talk-Plugin<br/>Unraid]
V --> RV[Realtime-Voice-Brücke<br/>Athena, WebRTC]
RV --> STT
RV --> T
RV -->|Agentenantwort| OC
H -->|OpenAI API| R[Profile Router<br/>Athena :8081]
R --> P[Profile Controller]
P --> Q[genau ein llama.cpp-Profil<br/>Qwen Fast / Medium / Large / Ultra / Uncensored]
R --> I[Qwen-Image-2.1 INT8<br/>RTX 5080, Text + Editing]
R --> T[Qwen3-TTS 1.7B RTX 3060<br/>TTS-Gateway]
R --> STT[Whisper.cpp small<br/>CPU, lokale Spracherkennung]
H --> U[MUA / Unraid MCP]
H --> A[ARR-MCP]
H --> D[Deemix-MCP]
H --> N[Navidrome-MCP]
H --> S[STRATO-MCP]
H --> X[Nginx-Proxy-Manager-MCP]
U --> M[Media-Tools<br/>ffmpeg / ffprobe / yt-dlp]
W[WireGuard-Gateway<br/>Athena] --- R
W --- B[Athena Dashboard :8099]
W --- PRT[Portainer :9443<br/>optionale Docker-Ansicht]
W --- O[Athena Operator]
W --- AP[Mikes-Applio-UI<br/>eigener Checkout, GPU-los]
K[Backup alle 5 Stunden] --> DATA[/data und /etc/mike-ai]
Stand: 21. September 2026. Versionen und Abweichungen: Live-Stand.
Qwen Image nutzt die RTX 5080 und pausiert dafür LLM und Qwen3-TTS. FLUX
bleibt als gestoppter Rückfallworker vorhanden. Dashboard und
Portainer besitzen eigene Netzwerk-Namespaces in mike-ai_frontend; der Router
läuft in mike-ai_control. Der Gateway vermittelt den privaten Zugriff.
Zusätzliche Musik-, Audio-, Voice- und 3D-Container stehen im
Container-Inventar; ihre Anwesenheit ist kein neuer Funktionstest.
Verantwortung
- Unraid hält Hermes, Chats, Skills, Fach-MCPs und deren Appdata.
- Athena rechnet: Text, Bild und Sprache; Router und Dashboard koordinieren und beobachten die Inferenz.
- MUA verwaltet Unraid. Athena Operator bleibt auf den Athena-Host begrenzt.
- Der Router ist die einzige Modelladresse, die Hermes kennen muss.
Dynamische Qwen-Profile
Der Profile Router hält immer nur ein Qwen-Profil aktiv. Ein Wechsel lädt das zum Profil gehörende 27B-Modell mit der zum Profil gehörenden GPU-Aufteilung und Kontextgröße:
| Profil | Kontextfenster |
|---|---|
| Fast | 76.800 Token |
| Medium | 160.000 Token |
| Large | 192.000 Token |
| Ultra | 262.144 Token |
| Uncensored | 80.000 Token |
Die PNG-Karten athena-architecture-map.png und athena-gpu-allocation-map.png
sind historische Darstellungen. Bei abweichenden Modell- oder Netzwerkangaben
gelten diese Textdokumentation und der geprüfte Live-Stand.