# Aktuelle Architektur
```mermaid
flowchart LR
C[Hermes Desktop / Web / Mobil] --> H[Hermes Agent
Unraid]
H -->|OpenAI API| R[Profile Router
Athena :8081]
R --> P[Profile Controller]
P --> Q[genau ein llama.cpp-Profil
Qwen Fast / Medium / Large / Ultra / Uncensored]
R --> I[FLUX.2-klein-4B
RTX 5080, Text + Editing]
R --> T[XTTS RTX 3060
Piper CPU-Fallback]
R --> STT[Whisper.cpp large-v3-turbo
CPU, lokale Spracherkennung]
H --> U[MUA / Unraid MCP]
H --> A[ARR-MCP]
H --> D[Deemix-MCP]
H --> N[Navidrome-MCP]
H --> S[STRATO-MCP]
H --> X[Nginx-Proxy-Manager-MCP]
U --> M[Media-Tools
ffmpeg / ffprobe / yt-dlp]
W[WireGuard-Gateway
Athena] --- R
W --- B[Athena Dashboard :8099]
W --- PRT[Portainer :9443
optionale Docker-Ansicht]
W --- O[Athena Operator]
K[Backup alle 5 Stunden] --> DATA[/data und /etc/mike-ai]
```
## Verantwortung
- **Unraid** hält Hermes, Chats, Skills, Fach-MCPs und deren Appdata.
- **Athena** rechnet: Text, Bild und Sprache; Router und Dashboard koordinieren
und beobachten die Inferenz.
- **MUA** verwaltet Unraid. **Athena Operator** bleibt auf den Athena-Host
begrenzt.
- Der Router ist die einzige Modelladresse, die Hermes kennen muss.
## Dynamische Qwen-Profile
Der Profile Router hält immer nur ein Qwen-Profil aktiv. Ein Wechsel lädt
dasselbe 27B-Modell mit der zum Profil gehörenden GPU-Aufteilung und
Kontextgröße:
| Profil | Kontextfenster |
| --- | ---: |
| Fast | 76.800 Token |
| Medium | 160.000 Token |
| Large | 192.000 Token |
| Ultra | 262.144 Token |
| Uncensored | 80.000 Token |
Die visuelle Fassung liegt als `athena-architecture-map.png` neben dieser Datei.
Eine zweite Detailkarte, `athena-gpu-allocation-map.png`, zeigt die
profilabhängige Layer-Verteilung auf RTX 5080 und RTX 3060 sowie die festen
GPU-Zuordnungen von FLUX.2, Vision-Projektor und XTTS.