Make reasoning levels enforce real token budgets
This commit is contained in:
@@ -59,6 +59,16 @@ versionierten Modellartefakte und startet ausschließlich den Athena-Kern.
|
||||
sudo ./smoke-test.sh
|
||||
```
|
||||
|
||||
### Reasoning-Stufen
|
||||
|
||||
Der Router übersetzt die Auswahl eines OpenAI-kompatiblen Clients in echte,
|
||||
pro Anfrage geltende llama.cpp-Denkbudgets. `Off` deaktiviert Thinking; die
|
||||
aktiven Stufen sind auf 256 (Minimal), 768 (Low), 2048 (Medium), 4096 (High)
|
||||
und 8192 Tokens (XHigh/Max/Ultra) begrenzt. Die Modellserver dürfen deshalb
|
||||
kein festes `--reasoning-budget` setzen, da dieses die dynamischen Budgets
|
||||
von llama.cpp übersteuern würde. Clients, die direkt
|
||||
`thinking_budget_tokens` senden, behalten ihren expliziten Wert.
|
||||
|
||||
### Ein oder zwei Modell-Slots
|
||||
|
||||
Produktiv laufen alle Profile mit einem Slot. Damit erhält ein einzelner Chat
|
||||
|
||||
Reference in New Issue
Block a user