Keep experimental compressor stopped by default
This commit is contained in:
@@ -32,9 +32,9 @@ und einer bewussten Aktualisierung dieser Datei.
|
||||
|
||||
## Experimentelles Hermes-Kompressionsmodell
|
||||
|
||||
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M läuft
|
||||
unabhängig mit 65.536 Token Kontext auf der RTX 3060 und ist nur über
|
||||
WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
|
||||
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M kann
|
||||
unabhängig mit 65.536 Token Kontext auf der RTX 3060 gestartet werden und ist
|
||||
dann nur über WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
|
||||
verhindern bekannte Wiederholungsschleifen. Das Modell ist absichtlich **nicht
|
||||
global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
|
||||
27B-Hauptprofil.
|
||||
@@ -49,7 +49,8 @@ global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
|
||||
verbleibend rund 2.460 MiB.
|
||||
- Sicherheitsentscheidung: als reproduzierbarer Testdienst behalten, aber
|
||||
erst nach zuverlässig vollständiger technischer Zustandsbewahrung als
|
||||
globalen Kompressor freigeben.
|
||||
globalen Kompressor freigeben. Der Container bleibt außerhalb gezielter
|
||||
Benchmarks gestoppt, damit die RTX 3060 für Medium/Large/Ultra frei ist.
|
||||
|
||||
## Nachweise
|
||||
|
||||
|
||||
Reference in New Issue
Block a user