simplify Athena runtime and centralize MCP management

This commit is contained in:
Mikei386
2026-08-26 09:57:38 +02:00
parent 104c9904a5
commit ab671a6396
31 changed files with 918 additions and 419 deletions
+16
View File
@@ -0,0 +1,16 @@
# MCP-Server
Diese Datei wird aus `config/mcp-registry.json` erzeugt. Änderungen gehören nur in die JSON-Registry.
| Server | Hermes-ID | Endpunkt | Clients | Werkzeuge |
|---|---|---|---|---:|
| Athena Operator | `athena-operator` | `http://192.168.1.2:8787/mcp/athena-operator` | hermes, openwebui | alle |
| GitHub (offiziell, read-only) | `github` | `http://192.168.1.2:8787/mcp/github` | hermes, openwebui | alle |
| Home Assistant | `homeassistant-admin` | `http://192.168.1.2:8787/mcp/homeassistant` | hermes, openwebui | alle |
| Sonarr und Radarr | `arr` | `http://192.168.1.2:8787/mcp/arr` | hermes, openwebui | alle |
| Navidrome | `navidrome` | `http://192.168.1.2:8787/mcp/navidrome` | hermes, openwebui | alle |
| Deemix | `deemix` | `http://192.168.1.2:8787/mcp/deemix` | hermes, openwebui | alle |
| MUA (Unraid-Verwaltung) | `unraid` | `http://192.168.1.2:8787/mcp/unraid` | hermes, openwebui | alle |
| FRITZ!Box | `fritzbox` | `http://192.168.1.2:8787/mcp/fritzbox` | hermes, openwebui | 4 |
Allgemeine Webrecherche ist ein eingebautes Hermes-Werkzeug und kein MCPHub-Server.
+3 -7
View File
@@ -3,18 +3,14 @@
## Was automatisch gesichert wird
Der Container `mike-ai-backup` erstellt alle fünf Stunden ein komprimiertes
Archiv unter `/data/docker-backups` und behält 14 Tage. Während der kurzen
Sicherung wird nur OpenWebUI angehalten, damit seine SQLite-Datenbank konsistent
ist. Netzwerk, WireGuard, Router und Qwen bleiben erreichbar. Hermes läuft
unabhängig davon auf Unraid weiter.
Archiv unter `/data/docker-backups` und behält 14 Tage. Netzwerk, WireGuard,
Router und Qwen bleiben dabei erreichbar. Hermes läuft unabhängig auf Unraid.
Enthalten sind:
- `/etc/mike-ai` mit lokalen Konfigurationen und Secrets
- OpenWebUI-Daten
- Router-Zustand und Router-Bildablage
- Piper-Daten
- TinySearch-Modellcache
- ein Quellbaum-Snapshot als zusätzliche Bequemlichkeit
Nicht kopiert werden `/data/models`, die nur noch als Rückfall vorhandene Kopie
@@ -84,7 +80,7 @@ docker compose --env-file /etc/mike-ai/stack.env ps
test -s /data/docker-backups/athena-latest.tar.gz
```
Danach einen OpenWebUI-Login, einen Router-Request und je einen read-only
Danach einen Router-Request, einen Hermes-Zweiturn-Chat und je einen read-only
MCP-Aufruf über `http://UNRAID-IP:8787/mcp/NAME` testen. Alte Recovery-Koffer
sind für Neuinstallationen nicht mehr erforderlich; Git, Athenas Datenbackup
und das Unraid-Appdata-Backup bilden die Wiederherstellung.
+16 -45
View File
@@ -1,50 +1,21 @@
# Verbindliche Standard-Profilmatrix
# Profilmatrix
Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für
Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test
und einer bewussten Aktualisierung dieser Datei.
Diese Datei wird aus `config/profile-matrix.json` erzeugt. Änderungen gehören nur in die JSON-Matrix.
| Profil | Virtuelles Modell | GGUF | Kontext | GPUs / Split | MTP | Vision | gemessene kurze Ausgabe |
|---|---|---|---:|---|---:|---|---:|
| Fast | `qwen-fast` | IQ4-MIX | 76.800 | RTX 5080 | 2 | ja, Projektor auf RTX 3060 | 85,5 Tok/s |
| **Medium (Default)** | `qwen-medium` | IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf RTX 3060 | 77,2 Tok/s |
| Large | `qwen-large` | IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf RTX 3060 | 75,3 Tok/s |
| Ultra | `qwen-ultra` | IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
| Uncensored | `qwen-uncensored` | Abliterated Q4_K_M | 80.000 | RTX 5080 + RTX 3060, 90:10 | 2 | ja, eigener Projektor auf RTX 3060 | 52,2 Tok/s |
Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
## Standardverhalten
| Profil | API-Alias | Kontext | Modell | GPU-Verteilung | Vision | MTP |
|---|---|---:|---|---|---|---:|
| fast | `qwen-fast` | 76,800 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
| medium | `qwen-medium` | 160,000 | Qwen3.8-27B IQ4 XS Pure | 90:10 | ja | 3 |
| large | `qwen-large` | 192,000 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
| ultra | `qwen-ultra` | 262,144 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
| uncensored | `qwen-uncensored` | 80,000 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |
- Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive
Standardprofil.
- Open WebUI erhält `mikeai-medium` als Standardmodell.
- Im OpenWebUI-Arbeitsbereich ist dieses auf `qwen-medium` basierende Preset
`mikeai-medium` die sichtbare Standardauswahl; die fünf rohen `qwen-*`-Aliase
bleiben ausgeblendet.
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
aus; es ist immer nur ein Inferenzcontainer aktiv.
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
lädt deshalb keinen Vision-Projektor.
- Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter
Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch
Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
in Open WebUI nicht als reguläres Modell angeboten.
## Zweck
## Hermes-Kontextpflege
Hermes verwendet das jeweils ausgewählte 27B-Profil auch für die
Kontextzusammenfassung. Micro-Compaction übernimmt alle fünf abgeschlossenen
Turns einen älteren Assistenten-/Werkzeugabschnitt in die laufende
Zusammenfassung. Die normale schwellenbasierte Kompression bleibt als
Rückfallebene aktiv. Ein separates kleines Kompressionsmodell wird nicht
installiert, weil 2B/4B-Tests exakte technische Zustände verlieren konnten.
## Nachweise
- Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
- Medium 160K: Pure 90:10 mit MTP3, 77,22 Tok/s.
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
- Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest,
Vision und synthetischer Logik-/Sicherheitslauf bestanden.
- **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben.
- **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben.
- **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten.
- **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor.
- **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert.