Map Hermes reasoning controls into Qwen templates

This commit is contained in:
Mikei386
2026-08-25 14:52:43 +02:00
parent 7df28d9750
commit 63fc921988
6 changed files with 149 additions and 2 deletions
+7
View File
@@ -199,6 +199,13 @@ Open WebUI spricht nur mit dem Router auf dessen OpenAI-kompatibler `/v1`-API.
Ein direkter Zugriff auf llama.cpp würde Profilumschaltung, Authentisierung,
Vision-, Bild-, STT- und TTS-Routing umgehen.
Der Router ist außerdem die verbindliche Kompatibilitätsschicht für Thinking:
Clients senden das OpenAI-/Hermes-Feld `reasoning_effort`; der Router überführt
es in `chat_template_kwargs.reasoning_effort` beziehungsweise bei `none` in
`enable_thinking: false`. Diese Übersetzung darf bei einem Router-Umbau nicht
entfernt werden, weil llama.cpp das gleichnamige Top-Level-Feld nicht an das
Qwen3.8-Chat-Template weiterreicht.
Sichtbare Arbeitsbereichsmodelle sind Fast, Medium, Large, Ultra und
Uncensored. Die rohen `qwen-*`-Aliase bleiben ausgeblendet. Globale Filter
behandeln Reasoning, Thinking, Kontext-/Toolschleifen, Secret-Redaktion,