Keep experimental compressor stopped by default

This commit is contained in:
Mikei386
2026-08-26 01:42:14 +02:00
parent aaadc57c07
commit 438bd34b72
2 changed files with 8 additions and 6 deletions
+3 -2
View File
@@ -10,8 +10,9 @@ zusammen mit dem übrigen Appdata gesichert.
- `compose.yaml` ist der einzige Einstieg für die KI-Dienste auf Athena.
- Genau ein llama.cpp-Profil ist aktiv. Der Router schaltet zwischen Fast,
Medium, Large, Ultra und Uncensored.
- Ein unabhängiges Qwen3.5-4B-Testmodell läuft auf der RTX 3060 über
`http://192.168.1.212:8099/v1`. Es ist ein optionaler Benchmark-Endpunkt und
- Ein unabhängiges Qwen3.5-4B-Testmodell kann auf der RTX 3060 über
`http://192.168.1.212:8099/v1` gezielt gestartet werden. Es ist ein
standardmäßig gestoppter, optionaler Benchmark-Endpunkt und
ausdrücklich **nicht** global für Hermes-Kompression aktiviert: technische
End-to-End-Tests zeigten trotz hoher Gesamttreue ausgelassene ältere
`KEY=value`-Zustände. Produktive Kompression übernimmt das jeweils gewählte
+5 -4
View File
@@ -32,9 +32,9 @@ und einer bewussten Aktualisierung dieser Datei.
## Experimentelles Hermes-Kompressionsmodell
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M läuft
unabhängig mit 65.536 Token Kontext auf der RTX 3060 und ist nur über
WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M kann
unabhängig mit 65.536 Token Kontext auf der RTX 3060 gestartet werden und ist
dann nur über WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
verhindern bekannte Wiederholungsschleifen. Das Modell ist absichtlich **nicht
global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
27B-Hauptprofil.
@@ -49,7 +49,8 @@ global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
verbleibend rund 2.460 MiB.
- Sicherheitsentscheidung: als reproduzierbarer Testdienst behalten, aber
erst nach zuverlässig vollständiger technischer Zustandsbewahrung als
globalen Kompressor freigeben.
globalen Kompressor freigeben. Der Container bleibt außerhalb gezielter
Benchmarks gestoppt, damit die RTX 3060 für Medium/Large/Ultra frei ist.
## Nachweise