Map Hermes reasoning controls into Qwen templates
This commit is contained in:
1 parent
7df28d9750
commit
63fc921988
6 files changed
+149
-2
No files matched your search
@@ -78,6 +78,13 @@ Zielplattform.
|
||||
Der Router übernimmt:
|
||||
|
||||
- OpenAI-kompatibles Chat-Proxying und Streaming
|
||||
- Übersetzung von OpenAI-/Hermes-`reasoning_effort` in die vom
|
||||
Qwen3.8-Jinja-Template tatsächlich ausgewerteten
|
||||
`chat_template_kwargs`: `none` deaktiviert Thinking mit
|
||||
`enable_thinking: false`; `low` und `medium` bleiben erhalten; höhere
|
||||
Client-Stufen werden auf das vom Modell unterstützte `xhigh` begrenzt.
|
||||
Das ist absichtlich zentral im Router implementiert, damit Hermes,
|
||||
OpenWebUI und weitere OpenAI-kompatible Clients identisches Verhalten haben.
|
||||
- virtuelle Modelle und automatische Profilumschaltung
|
||||
- Tool Calls
|
||||
- direkte integrierte Vision in Fast, Medium, Large und Uncensored
|
||||
@@ -98,8 +105,10 @@ Der Router übernimmt:
|
||||
- Die Kompressionszusammenfassung nutzt weiterhin dasselbe aktive Modell. Ein
|
||||
kleineres Fast-Modell wäre zwar schneller, besitzt aber nicht genug Kontext,
|
||||
um die vollständige Mitte einer Medium-, Large- oder Ultra-Sitzung sicher zu
|
||||
verarbeiten. `reasoning_effort: none` vermeidet unnötiges Nachdenken beim
|
||||
reinen Zusammenfassen.
|
||||
verarbeiten. `reasoning_effort: none` wird vom Router in
|
||||
`enable_thinking: false` übersetzt und vermeidet damit nachweislich
|
||||
unnötiges Nachdenken beim reinen Zusammenfassen. Ein unverändert an
|
||||
llama.cpp gesendetes Top-Level-`reasoning_effort` wäre wirkungslos.
|
||||
- `Summarizing thread` ist eine echte zusätzliche Modellanfrage. Bei sehr alten
|
||||
Sitzungen kann die Desktop-Anzeige nach abgeschlossener Kompression außerdem
|
||||
veraltet stehen bleiben. Maßgeblich sind dann Sitzungsfortschritt und
|
||||
|
||||
Reference in new issue
Block a user