Map Hermes reasoning controls into Qwen templates

This commit is contained in:
Mikei386 committed 2026-08-25 14:52:43 +02:00
1 parent 7df28d9750
commit 63fc921988
6 files changed
+149 -2

No files matched your search

+11 -2
View File
@@ -78,6 +78,13 @@ Zielplattform.
Der Router übernimmt:
- OpenAI-kompatibles Chat-Proxying und Streaming
- Übersetzung von OpenAI-/Hermes-`reasoning_effort` in die vom
Qwen3.8-Jinja-Template tatsächlich ausgewerteten
`chat_template_kwargs`: `none` deaktiviert Thinking mit
`enable_thinking: false`; `low` und `medium` bleiben erhalten; höhere
Client-Stufen werden auf das vom Modell unterstützte `xhigh` begrenzt.
Das ist absichtlich zentral im Router implementiert, damit Hermes,
OpenWebUI und weitere OpenAI-kompatible Clients identisches Verhalten haben.
- virtuelle Modelle und automatische Profilumschaltung
- Tool Calls
- direkte integrierte Vision in Fast, Medium, Large und Uncensored
@@ -98,8 +105,10 @@ Der Router übernimmt:
- Die Kompressionszusammenfassung nutzt weiterhin dasselbe aktive Modell. Ein
kleineres Fast-Modell wäre zwar schneller, besitzt aber nicht genug Kontext,
um die vollständige Mitte einer Medium-, Large- oder Ultra-Sitzung sicher zu
verarbeiten. `reasoning_effort: none` vermeidet unnötiges Nachdenken beim
reinen Zusammenfassen.
verarbeiten. `reasoning_effort: none` wird vom Router in
`enable_thinking: false` übersetzt und vermeidet damit nachweislich
unnötiges Nachdenken beim reinen Zusammenfassen. Ein unverändert an
llama.cpp gesendetes Top-Level-`reasoning_effort` wäre wirkungslos.
- `Summarizing thread` ist eine echte zusätzliche Modellanfrage. Bei sehr alten
Sitzungen kann die Desktop-Anzeige nach abgeschlossener Kompression außerdem
veraltet stehen bleiben. Maßgeblich sind dann Sitzungsfortschritt und