Map Hermes reasoning controls into Qwen templates

This commit is contained in:
Mikei386
2026-08-25 14:52:43 +02:00
parent 7df28d9750
commit 63fc921988
6 changed files with 149 additions and 2 deletions
+11 -2
View File
@@ -78,6 +78,13 @@ Zielplattform.
Der Router übernimmt:
- OpenAI-kompatibles Chat-Proxying und Streaming
- Übersetzung von OpenAI-/Hermes-`reasoning_effort` in die vom
Qwen3.8-Jinja-Template tatsächlich ausgewerteten
`chat_template_kwargs`: `none` deaktiviert Thinking mit
`enable_thinking: false`; `low` und `medium` bleiben erhalten; höhere
Client-Stufen werden auf das vom Modell unterstützte `xhigh` begrenzt.
Das ist absichtlich zentral im Router implementiert, damit Hermes,
OpenWebUI und weitere OpenAI-kompatible Clients identisches Verhalten haben.
- virtuelle Modelle und automatische Profilumschaltung
- Tool Calls
- direkte integrierte Vision in Fast, Medium, Large und Uncensored
@@ -98,8 +105,10 @@ Der Router übernimmt:
- Die Kompressionszusammenfassung nutzt weiterhin dasselbe aktive Modell. Ein
kleineres Fast-Modell wäre zwar schneller, besitzt aber nicht genug Kontext,
um die vollständige Mitte einer Medium-, Large- oder Ultra-Sitzung sicher zu
verarbeiten. `reasoning_effort: none` vermeidet unnötiges Nachdenken beim
reinen Zusammenfassen.
verarbeiten. `reasoning_effort: none` wird vom Router in
`enable_thinking: false` übersetzt und vermeidet damit nachweislich
unnötiges Nachdenken beim reinen Zusammenfassen. Ein unverändert an
llama.cpp gesendetes Top-Level-`reasoning_effort` wäre wirkungslos.
- `Summarizing thread` ist eine echte zusätzliche Modellanfrage. Bei sehr alten
Sitzungen kann die Desktop-Anzeige nach abgeschlossener Kompression außerdem
veraltet stehen bleiben. Maßgeblich sind dann Sitzungsfortschritt und
+7
View File
@@ -199,6 +199,13 @@ Open WebUI spricht nur mit dem Router auf dessen OpenAI-kompatibler `/v1`-API.
Ein direkter Zugriff auf llama.cpp würde Profilumschaltung, Authentisierung,
Vision-, Bild-, STT- und TTS-Routing umgehen.
Der Router ist außerdem die verbindliche Kompatibilitätsschicht für Thinking:
Clients senden das OpenAI-/Hermes-Feld `reasoning_effort`; der Router überführt
es in `chat_template_kwargs.reasoning_effort` beziehungsweise bei `none` in
`enable_thinking: false`. Diese Übersetzung darf bei einem Router-Umbau nicht
entfernt werden, weil llama.cpp das gleichnamige Top-Level-Feld nicht an das
Qwen3.8-Chat-Template weiterreicht.
Sichtbare Arbeitsbereichsmodelle sind Fast, Medium, Large, Ultra und
Uncensored. Die rohen `qwen-*`-Aliase bleiben ausgeblendet. Globale Filter
behandeln Reasoning, Thinking, Kontext-/Toolschleifen, Secret-Redaktion,