diff --git a/README.md b/README.md index 484a9a5..73c7c4f 100644 --- a/README.md +++ b/README.md @@ -10,8 +10,9 @@ zusammen mit dem übrigen Appdata gesichert. - `compose.yaml` ist der einzige Einstieg für die KI-Dienste auf Athena. - Genau ein llama.cpp-Profil ist aktiv. Der Router schaltet zwischen Fast, Medium, Large, Ultra und Uncensored. -- Ein unabhängiges Qwen3.5-4B-Testmodell läuft auf der RTX 3060 über - `http://192.168.1.212:8099/v1`. Es ist ein optionaler Benchmark-Endpunkt und +- Ein unabhängiges Qwen3.5-4B-Testmodell kann auf der RTX 3060 über + `http://192.168.1.212:8099/v1` gezielt gestartet werden. Es ist ein + standardmäßig gestoppter, optionaler Benchmark-Endpunkt und ausdrücklich **nicht** global für Hermes-Kompression aktiviert: technische End-to-End-Tests zeigten trotz hoher Gesamttreue ausgelassene ältere `KEY=value`-Zustände. Produktive Kompression übernimmt das jeweils gewählte diff --git a/docs/STANDARD_PROFILE_MATRIX.md b/docs/STANDARD_PROFILE_MATRIX.md index b17787f..755c840 100644 --- a/docs/STANDARD_PROFILE_MATRIX.md +++ b/docs/STANDARD_PROFILE_MATRIX.md @@ -32,9 +32,9 @@ und einer bewussten Aktualisierung dieser Datei. ## Experimentelles Hermes-Kompressionsmodell -Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M läuft -unabhängig mit 65.536 Token Kontext auf der RTX 3060 und ist nur über -WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit +Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M kann +unabhängig mit 65.536 Token Kontext auf der RTX 3060 gestartet werden und ist +dann nur über WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit verhindern bekannte Wiederholungsschleifen. Das Modell ist absichtlich **nicht global in Hermes aktiviert**; produktive Kompression nutzt das gewählte 27B-Hauptprofil. @@ -49,7 +49,8 @@ global in Hermes aktiviert**; produktive Kompression nutzt das gewählte verbleibend rund 2.460 MiB. - Sicherheitsentscheidung: als reproduzierbarer Testdienst behalten, aber erst nach zuverlässig vollständiger technischer Zustandsbewahrung als - globalen Kompressor freigeben. + globalen Kompressor freigeben. Der Container bleibt außerhalb gezielter + Benchmarks gestoppt, damit die RTX 3060 für Medium/Large/Ultra frei ist. ## Nachweise