Document reasoning effort compatibility and verification
This commit is contained in:
+17
@@ -73,6 +73,23 @@ und Streaming-Optionen; unbekannte Erweiterungsfelder werden abgelehnt. Maximal
|
||||
Cross-Origin-Browserfreigabe. Internes llama.cpp-HTTP-Zeitlimit: 120 Sekunden ohne
|
||||
Antwortdaten, maximal 600 Sekunden für laufende SSE-Ausgabe.
|
||||
|
||||
### Denkstufen (`reasoning_effort`)
|
||||
|
||||
Die API nimmt die Client-Werte `none`, `minimal`, `low`, `medium`, `high`,
|
||||
`xhigh`, `max` und `ultra` entgegen. Die auf Athena installierte llama.cpp-Laufzeit
|
||||
akzeptiert davon `none`, `low`, `medium`, `high` und `xhigh`; `minimal` und `max`
|
||||
führten bei einem direkten Test zu HTTP 500. Deck übersetzt daher `minimal` nach
|
||||
`low` und `max` sowie `ultra` nach `xhigh`. Die übrigen Werte bleiben unverändert.
|
||||
Diese Übersetzung gilt für jeden API-Client und ändert keine Profilparameter.
|
||||
Die Antwortheader `X-Athena-Reasoning-Requested` und
|
||||
`X-Athena-Reasoning-Effective` zeigen den angeforderten und den tatsächlich an
|
||||
llama.cpp gesendeten Wert. Denkstufen sind Modell-Template-Hinweise, keine
|
||||
garantierten Rechenbudgets oder exakt gleichwertigen Stufen.
|
||||
|
||||
Am 29.09.2026 wurden nach dieser Korrektur SSE-Anfragen mit `minimal` und `max`
|
||||
jeweils mit HTTP 200 und abschließendem `[DONE]` geprüft; ein synthetischer
|
||||
Hermes-Agent-Aufruf mit Denkstufe „Min“ war ebenfalls erfolgreich.
|
||||
|
||||
## Prozesssteuerung und Speicher
|
||||
|
||||
- Eigener nativer llama-server aus dem gewählten, geprüften CUDA-Build. Kein
|
||||
|
||||
Reference in New Issue
Block a user