Add dedicated Hermes compression model
This commit is contained in:
@@ -30,6 +30,20 @@ und einer bewussten Aktualisierung dieser Datei.
|
||||
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
|
||||
in Open WebUI nicht als reguläres Modell angeboten.
|
||||
|
||||
## Hermes-Kompressionsmodell
|
||||
|
||||
Das Hilfsmodell `qwen-compression` ist kein Chatprofil. Qwen3.5-2B Q4_K_M
|
||||
läuft unabhängig mit 65.536 Token Kontext auf der RTX 3060 und ist nur über
|
||||
WireGuard auf Port 8099 erreichbar. Hermes erzwingt dafür Non-Thinking.
|
||||
|
||||
- 30.245 Token, kalter Prompt: 4.519,7 Prefill-Tok/s.
|
||||
- Ausgabe im 30K-Qualitätstest: 117,1 Tok/s; vier von fünf ungefilterten
|
||||
Ankern bewahrt.
|
||||
- Echter Hermes-Hilfsmodellaufruf: 158 Token in 4,6 Sekunden; alle geforderten
|
||||
Pfade, Ports, Verbote und der Commit-Anker wurden bewahrt.
|
||||
- Zusätzlicher Speicherbedarf auf der RTX 3060: rund 1,8 GiB; nach dem Laden
|
||||
blieben im gemessenen Produktionszustand rund 4,5 GiB frei.
|
||||
|
||||
## Nachweise
|
||||
|
||||
- Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
|
||||
|
||||
Reference in New Issue
Block a user