Document reasoning effort compatibility and verification

This commit is contained in:
Mikei386 committed 2026-09-29 21:53:13 +02:00
1 parent fd2c21f208
commit be40869712
1 file changed
+17
+17
View File
@@ -73,6 +73,23 @@ und Streaming-Optionen; unbekannte Erweiterungsfelder werden abgelehnt. Maximal
Cross-Origin-Browserfreigabe. Internes llama.cpp-HTTP-Zeitlimit: 120 Sekunden ohne Cross-Origin-Browserfreigabe. Internes llama.cpp-HTTP-Zeitlimit: 120 Sekunden ohne
Antwortdaten, maximal 600 Sekunden für laufende SSE-Ausgabe. Antwortdaten, maximal 600 Sekunden für laufende SSE-Ausgabe.
### Denkstufen (`reasoning_effort`)
Die API nimmt die Client-Werte `none`, `minimal`, `low`, `medium`, `high`,
`xhigh`, `max` und `ultra` entgegen. Die auf Athena installierte llama.cpp-Laufzeit
akzeptiert davon `none`, `low`, `medium`, `high` und `xhigh`; `minimal` und `max`
führten bei einem direkten Test zu HTTP 500. Deck übersetzt daher `minimal` nach
`low` und `max` sowie `ultra` nach `xhigh`. Die übrigen Werte bleiben unverändert.
Diese Übersetzung gilt für jeden API-Client und ändert keine Profilparameter.
Die Antwortheader `X-Athena-Reasoning-Requested` und
`X-Athena-Reasoning-Effective` zeigen den angeforderten und den tatsächlich an
llama.cpp gesendeten Wert. Denkstufen sind Modell-Template-Hinweise, keine
garantierten Rechenbudgets oder exakt gleichwertigen Stufen.
Am 29.09.2026 wurden nach dieser Korrektur SSE-Anfragen mit `minimal` und `max`
jeweils mit HTTP 200 und abschließendem `[DONE]` geprüft; ein synthetischer
Hermes-Agent-Aufruf mit Denkstufe „Min“ war ebenfalls erfolgreich.
## Prozesssteuerung und Speicher ## Prozesssteuerung und Speicher
- Eigener nativer llama-server aus dem gewählten, geprüften CUDA-Build. Kein - Eigener nativer llama-server aus dem gewählten, geprüften CUDA-Build. Kein