diff --git a/ENDPOINT.md b/ENDPOINT.md index 94fe0e1..98338e4 100644 --- a/ENDPOINT.md +++ b/ENDPOINT.md @@ -73,6 +73,23 @@ und Streaming-Optionen; unbekannte Erweiterungsfelder werden abgelehnt. Maximal Cross-Origin-Browserfreigabe. Internes llama.cpp-HTTP-Zeitlimit: 120 Sekunden ohne Antwortdaten, maximal 600 Sekunden für laufende SSE-Ausgabe. +### Denkstufen (`reasoning_effort`) + +Die API nimmt die Client-Werte `none`, `minimal`, `low`, `medium`, `high`, +`xhigh`, `max` und `ultra` entgegen. Die auf Athena installierte llama.cpp-Laufzeit +akzeptiert davon `none`, `low`, `medium`, `high` und `xhigh`; `minimal` und `max` +führten bei einem direkten Test zu HTTP 500. Deck übersetzt daher `minimal` nach +`low` und `max` sowie `ultra` nach `xhigh`. Die übrigen Werte bleiben unverändert. +Diese Übersetzung gilt für jeden API-Client und ändert keine Profilparameter. +Die Antwortheader `X-Athena-Reasoning-Requested` und +`X-Athena-Reasoning-Effective` zeigen den angeforderten und den tatsächlich an +llama.cpp gesendeten Wert. Denkstufen sind Modell-Template-Hinweise, keine +garantierten Rechenbudgets oder exakt gleichwertigen Stufen. + +Am 29.09.2026 wurden nach dieser Korrektur SSE-Anfragen mit `minimal` und `max` +jeweils mit HTTP 200 und abschließendem `[DONE]` geprüft; ein synthetischer +Hermes-Agent-Aufruf mit Denkstufe „Min“ war ebenfalls erfolgreich. + ## Prozesssteuerung und Speicher - Eigener nativer llama-server aus dem gewählten, geprüften CUDA-Build. Kein