simplify Athena runtime and centralize MCP management
This commit is contained in:
@@ -0,0 +1,16 @@
|
||||
# MCP-Server
|
||||
|
||||
Diese Datei wird aus `config/mcp-registry.json` erzeugt. Änderungen gehören nur in die JSON-Registry.
|
||||
|
||||
| Server | Hermes-ID | Endpunkt | Clients | Werkzeuge |
|
||||
|---|---|---|---|---:|
|
||||
| Athena Operator | `athena-operator` | `http://192.168.1.2:8787/mcp/athena-operator` | hermes, openwebui | alle |
|
||||
| GitHub (offiziell, read-only) | `github` | `http://192.168.1.2:8787/mcp/github` | hermes, openwebui | alle |
|
||||
| Home Assistant | `homeassistant-admin` | `http://192.168.1.2:8787/mcp/homeassistant` | hermes, openwebui | alle |
|
||||
| Sonarr und Radarr | `arr` | `http://192.168.1.2:8787/mcp/arr` | hermes, openwebui | alle |
|
||||
| Navidrome | `navidrome` | `http://192.168.1.2:8787/mcp/navidrome` | hermes, openwebui | alle |
|
||||
| Deemix | `deemix` | `http://192.168.1.2:8787/mcp/deemix` | hermes, openwebui | alle |
|
||||
| MUA (Unraid-Verwaltung) | `unraid` | `http://192.168.1.2:8787/mcp/unraid` | hermes, openwebui | alle |
|
||||
| FRITZ!Box | `fritzbox` | `http://192.168.1.2:8787/mcp/fritzbox` | hermes, openwebui | 4 |
|
||||
|
||||
Allgemeine Webrecherche ist ein eingebautes Hermes-Werkzeug und kein MCPHub-Server.
|
||||
+3
-7
@@ -3,18 +3,14 @@
|
||||
## Was automatisch gesichert wird
|
||||
|
||||
Der Container `mike-ai-backup` erstellt alle fünf Stunden ein komprimiertes
|
||||
Archiv unter `/data/docker-backups` und behält 14 Tage. Während der kurzen
|
||||
Sicherung wird nur OpenWebUI angehalten, damit seine SQLite-Datenbank konsistent
|
||||
ist. Netzwerk, WireGuard, Router und Qwen bleiben erreichbar. Hermes läuft
|
||||
unabhängig davon auf Unraid weiter.
|
||||
Archiv unter `/data/docker-backups` und behält 14 Tage. Netzwerk, WireGuard,
|
||||
Router und Qwen bleiben dabei erreichbar. Hermes läuft unabhängig auf Unraid.
|
||||
|
||||
Enthalten sind:
|
||||
|
||||
- `/etc/mike-ai` mit lokalen Konfigurationen und Secrets
|
||||
- OpenWebUI-Daten
|
||||
- Router-Zustand und Router-Bildablage
|
||||
- Piper-Daten
|
||||
- TinySearch-Modellcache
|
||||
- ein Quellbaum-Snapshot als zusätzliche Bequemlichkeit
|
||||
|
||||
Nicht kopiert werden `/data/models`, die nur noch als Rückfall vorhandene Kopie
|
||||
@@ -84,7 +80,7 @@ docker compose --env-file /etc/mike-ai/stack.env ps
|
||||
test -s /data/docker-backups/athena-latest.tar.gz
|
||||
```
|
||||
|
||||
Danach einen OpenWebUI-Login, einen Router-Request und je einen read-only
|
||||
Danach einen Router-Request, einen Hermes-Zweiturn-Chat und je einen read-only
|
||||
MCP-Aufruf über `http://UNRAID-IP:8787/mcp/NAME` testen. Alte Recovery-Koffer
|
||||
sind für Neuinstallationen nicht mehr erforderlich; Git, Athenas Datenbackup
|
||||
und das Unraid-Appdata-Backup bilden die Wiederherstellung.
|
||||
|
||||
@@ -1,50 +1,21 @@
|
||||
# Verbindliche Standard-Profilmatrix
|
||||
# Profilmatrix
|
||||
|
||||
Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für
|
||||
Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test
|
||||
und einer bewussten Aktualisierung dieser Datei.
|
||||
Diese Datei wird aus `config/profile-matrix.json` erzeugt. Änderungen gehören nur in die JSON-Matrix.
|
||||
|
||||
| Profil | Virtuelles Modell | GGUF | Kontext | GPUs / Split | MTP | Vision | gemessene kurze Ausgabe |
|
||||
|---|---|---|---:|---|---:|---|---:|
|
||||
| Fast | `qwen-fast` | IQ4-MIX | 76.800 | RTX 5080 | 2 | ja, Projektor auf RTX 3060 | 85,5 Tok/s |
|
||||
| **Medium (Default)** | `qwen-medium` | IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf RTX 3060 | 77,2 Tok/s |
|
||||
| Large | `qwen-large` | IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf RTX 3060 | 75,3 Tok/s |
|
||||
| Ultra | `qwen-ultra` | IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
|
||||
| Uncensored | `qwen-uncensored` | Abliterated Q4_K_M | 80.000 | RTX 5080 + RTX 3060, 90:10 | 2 | ja, eigener Projektor auf RTX 3060 | 52,2 Tok/s |
|
||||
Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
||||
|
||||
## Standardverhalten
|
||||
| Profil | API-Alias | Kontext | Modell | GPU-Verteilung | Vision | MTP |
|
||||
|---|---|---:|---|---|---|---:|
|
||||
| fast | `qwen-fast` | 76,800 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
|
||||
| medium | `qwen-medium` | 160,000 | Qwen3.8-27B IQ4 XS Pure | 90:10 | ja | 3 |
|
||||
| large | `qwen-large` | 192,000 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
|
||||
| ultra | `qwen-ultra` | 262,144 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
|
||||
| uncensored | `qwen-uncensored` | 80,000 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |
|
||||
|
||||
- Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive
|
||||
Standardprofil.
|
||||
- Open WebUI erhält `mikeai-medium` als Standardmodell.
|
||||
- Im OpenWebUI-Arbeitsbereich ist dieses auf `qwen-medium` basierende Preset
|
||||
`mikeai-medium` die sichtbare Standardauswahl; die fünf rohen `qwen-*`-Aliase
|
||||
bleiben ausgeblendet.
|
||||
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
|
||||
aus; es ist immer nur ein Inferenzcontainer aktiv.
|
||||
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
|
||||
lädt deshalb keinen Vision-Projektor.
|
||||
- Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter
|
||||
Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch
|
||||
Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
|
||||
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
|
||||
in Open WebUI nicht als reguläres Modell angeboten.
|
||||
## Zweck
|
||||
|
||||
## Hermes-Kontextpflege
|
||||
|
||||
Hermes verwendet das jeweils ausgewählte 27B-Profil auch für die
|
||||
Kontextzusammenfassung. Micro-Compaction übernimmt alle fünf abgeschlossenen
|
||||
Turns einen älteren Assistenten-/Werkzeugabschnitt in die laufende
|
||||
Zusammenfassung. Die normale schwellenbasierte Kompression bleibt als
|
||||
Rückfallebene aktiv. Ein separates kleines Kompressionsmodell wird nicht
|
||||
installiert, weil 2B/4B-Tests exakte technische Zustände verlieren konnten.
|
||||
|
||||
## Nachweise
|
||||
|
||||
- Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
|
||||
- Medium 160K: Pure 90:10 mit MTP3, 77,22 Tok/s.
|
||||
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
|
||||
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
|
||||
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
|
||||
- Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest,
|
||||
Vision und synthetischer Logik-/Sicherheitslauf bestanden.
|
||||
- **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben.
|
||||
- **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben.
|
||||
- **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten.
|
||||
- **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor.
|
||||
- **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert.
|
||||
|
||||
Reference in New Issue
Block a user