Map Hermes reasoning controls into Qwen templates
This commit is contained in:
@@ -78,6 +78,13 @@ Zielplattform.
|
||||
Der Router übernimmt:
|
||||
|
||||
- OpenAI-kompatibles Chat-Proxying und Streaming
|
||||
- Übersetzung von OpenAI-/Hermes-`reasoning_effort` in die vom
|
||||
Qwen3.8-Jinja-Template tatsächlich ausgewerteten
|
||||
`chat_template_kwargs`: `none` deaktiviert Thinking mit
|
||||
`enable_thinking: false`; `low` und `medium` bleiben erhalten; höhere
|
||||
Client-Stufen werden auf das vom Modell unterstützte `xhigh` begrenzt.
|
||||
Das ist absichtlich zentral im Router implementiert, damit Hermes,
|
||||
OpenWebUI und weitere OpenAI-kompatible Clients identisches Verhalten haben.
|
||||
- virtuelle Modelle und automatische Profilumschaltung
|
||||
- Tool Calls
|
||||
- direkte integrierte Vision in Fast, Medium, Large und Uncensored
|
||||
@@ -98,8 +105,10 @@ Der Router übernimmt:
|
||||
- Die Kompressionszusammenfassung nutzt weiterhin dasselbe aktive Modell. Ein
|
||||
kleineres Fast-Modell wäre zwar schneller, besitzt aber nicht genug Kontext,
|
||||
um die vollständige Mitte einer Medium-, Large- oder Ultra-Sitzung sicher zu
|
||||
verarbeiten. `reasoning_effort: none` vermeidet unnötiges Nachdenken beim
|
||||
reinen Zusammenfassen.
|
||||
verarbeiten. `reasoning_effort: none` wird vom Router in
|
||||
`enable_thinking: false` übersetzt und vermeidet damit nachweislich
|
||||
unnötiges Nachdenken beim reinen Zusammenfassen. Ein unverändert an
|
||||
llama.cpp gesendetes Top-Level-`reasoning_effort` wäre wirkungslos.
|
||||
- `Summarizing thread` ist eine echte zusätzliche Modellanfrage. Bei sehr alten
|
||||
Sitzungen kann die Desktop-Anzeige nach abgeschlossener Kompression außerdem
|
||||
veraltet stehen bleiben. Maßgeblich sind dann Sitzungsfortschritt und
|
||||
|
||||
@@ -199,6 +199,13 @@ Open WebUI spricht nur mit dem Router auf dessen OpenAI-kompatibler `/v1`-API.
|
||||
Ein direkter Zugriff auf llama.cpp würde Profilumschaltung, Authentisierung,
|
||||
Vision-, Bild-, STT- und TTS-Routing umgehen.
|
||||
|
||||
Der Router ist außerdem die verbindliche Kompatibilitätsschicht für Thinking:
|
||||
Clients senden das OpenAI-/Hermes-Feld `reasoning_effort`; der Router überführt
|
||||
es in `chat_template_kwargs.reasoning_effort` beziehungsweise bei `none` in
|
||||
`enable_thinking: false`. Diese Übersetzung darf bei einem Router-Umbau nicht
|
||||
entfernt werden, weil llama.cpp das gleichnamige Top-Level-Feld nicht an das
|
||||
Qwen3.8-Chat-Template weiterreicht.
|
||||
|
||||
Sichtbare Arbeitsbereichsmodelle sind Fast, Medium, Large, Ultra und
|
||||
Uncensored. Die rohen `qwen-*`-Aliase bleiben ausgeblendet. Globale Filter
|
||||
behandeln Reasoning, Thinking, Kontext-/Toolschleifen, Secret-Redaktion,
|
||||
|
||||
Reference in New Issue
Block a user