Keep experimental compressor stopped by default
This commit is contained in:
@@ -10,8 +10,9 @@ zusammen mit dem übrigen Appdata gesichert.
|
|||||||
- `compose.yaml` ist der einzige Einstieg für die KI-Dienste auf Athena.
|
- `compose.yaml` ist der einzige Einstieg für die KI-Dienste auf Athena.
|
||||||
- Genau ein llama.cpp-Profil ist aktiv. Der Router schaltet zwischen Fast,
|
- Genau ein llama.cpp-Profil ist aktiv. Der Router schaltet zwischen Fast,
|
||||||
Medium, Large, Ultra und Uncensored.
|
Medium, Large, Ultra und Uncensored.
|
||||||
- Ein unabhängiges Qwen3.5-4B-Testmodell läuft auf der RTX 3060 über
|
- Ein unabhängiges Qwen3.5-4B-Testmodell kann auf der RTX 3060 über
|
||||||
`http://192.168.1.212:8099/v1`. Es ist ein optionaler Benchmark-Endpunkt und
|
`http://192.168.1.212:8099/v1` gezielt gestartet werden. Es ist ein
|
||||||
|
standardmäßig gestoppter, optionaler Benchmark-Endpunkt und
|
||||||
ausdrücklich **nicht** global für Hermes-Kompression aktiviert: technische
|
ausdrücklich **nicht** global für Hermes-Kompression aktiviert: technische
|
||||||
End-to-End-Tests zeigten trotz hoher Gesamttreue ausgelassene ältere
|
End-to-End-Tests zeigten trotz hoher Gesamttreue ausgelassene ältere
|
||||||
`KEY=value`-Zustände. Produktive Kompression übernimmt das jeweils gewählte
|
`KEY=value`-Zustände. Produktive Kompression übernimmt das jeweils gewählte
|
||||||
|
|||||||
@@ -32,9 +32,9 @@ und einer bewussten Aktualisierung dieser Datei.
|
|||||||
|
|
||||||
## Experimentelles Hermes-Kompressionsmodell
|
## Experimentelles Hermes-Kompressionsmodell
|
||||||
|
|
||||||
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M läuft
|
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M kann
|
||||||
unabhängig mit 65.536 Token Kontext auf der RTX 3060 und ist nur über
|
unabhängig mit 65.536 Token Kontext auf der RTX 3060 gestartet werden und ist
|
||||||
WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
|
dann nur über WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
|
||||||
verhindern bekannte Wiederholungsschleifen. Das Modell ist absichtlich **nicht
|
verhindern bekannte Wiederholungsschleifen. Das Modell ist absichtlich **nicht
|
||||||
global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
|
global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
|
||||||
27B-Hauptprofil.
|
27B-Hauptprofil.
|
||||||
@@ -49,7 +49,8 @@ global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
|
|||||||
verbleibend rund 2.460 MiB.
|
verbleibend rund 2.460 MiB.
|
||||||
- Sicherheitsentscheidung: als reproduzierbarer Testdienst behalten, aber
|
- Sicherheitsentscheidung: als reproduzierbarer Testdienst behalten, aber
|
||||||
erst nach zuverlässig vollständiger technischer Zustandsbewahrung als
|
erst nach zuverlässig vollständiger technischer Zustandsbewahrung als
|
||||||
globalen Kompressor freigeben.
|
globalen Kompressor freigeben. Der Container bleibt außerhalb gezielter
|
||||||
|
Benchmarks gestoppt, damit die RTX 3060 für Medium/Large/Ultra frei ist.
|
||||||
|
|
||||||
## Nachweise
|
## Nachweise
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user