Use minimal reasoning for responsive Hermes chats
This commit is contained in:
@@ -140,7 +140,7 @@ Der Router übernimmt:
|
||||
80K; alle verwenden dieselben MCPs, Skills, Sprach- und Sicherheitsvorgaben
|
||||
- Profilübergreifende Latenzgrenzen: höchstens 8.192 Ausgabetoken je
|
||||
Modellaufruf (sichtbare Antwort, Tool-Aufruf und verborgenes Denken
|
||||
zusammen), Standard-Reasoning `low`; höhere Denkstufen bleiben pro Sitzung
|
||||
zusammen), Standard-Reasoning `minimal`; höhere Denkstufen bleiben pro Sitzung
|
||||
über `/reasoning` wählbar.
|
||||
- Automatische Sitzungstitel sind deaktiviert. Sie sind kosmetisch, erzeugten
|
||||
aber auf dem einzelnen llama.cpp-Slot nach dem ersten Turn konkurrierende
|
||||
|
||||
Reference in New Issue
Block a user