Harden and demote experimental Hermes compressor

This commit is contained in:
Mikei386
2026-08-26 01:40:38 +02:00
parent 99285fe81a
commit aaadc57c07
7 changed files with 52 additions and 40 deletions
+6 -3
View File
@@ -10,9 +10,12 @@ zusammen mit dem übrigen Appdata gesichert.
- `compose.yaml` ist der einzige Einstieg für die KI-Dienste auf Athena.
- Genau ein llama.cpp-Profil ist aktiv. Der Router schaltet zwischen Fast,
Medium, Large, Ultra und Uncensored.
- Ein unabhängiges Qwen3.5-2B-Modell auf der RTX 3060 komprimiert Hermes-Chats
über `http://192.168.1.212:8099/v1`. Es läuft ohne Thinking mit 65K Kontext
und blockiert dadurch weder Router noch das aktive 27B-Hauptmodell.
- Ein unabhängiges Qwen3.5-4B-Testmodell läuft auf der RTX 3060 über
`http://192.168.1.212:8099/v1`. Es ist ein optionaler Benchmark-Endpunkt und
ausdrücklich **nicht** global für Hermes-Kompression aktiviert: technische
End-to-End-Tests zeigten trotz hoher Gesamttreue ausgelassene ältere
`KEY=value`-Zustände. Produktive Kompression übernimmt das jeweils gewählte
27B-Hauptprofil.
- Der **Athena Operator** bleibt als einziger hostgebundener administrativer
MCP direkt auf Athena. MCPHub veröffentlicht seinen vorhandenen
WireGuard-HTTP-Endpunkt zentral unter `/mcp/athena-operator`; es gibt keinen