Document Hermes latency budget
This commit is contained in:
@@ -96,8 +96,10 @@ Der Router übernimmt:
|
|||||||
|
|
||||||
## Hermes Agent
|
## Hermes Agent
|
||||||
|
|
||||||
- Kontextkompression läuft frühzeitig bei 65 Prozent des jeweiligen
|
- Kontextkompression läuft spätestens bei 60.000 Token; die relative
|
||||||
Profilfensters. Alte große Werkzeugausgaben werden ab 50.000 Token zunächst
|
65-Prozent-Grenze greift nur, wenn sie noch früher erreicht wird. Damit gilt
|
||||||
|
dieselbe Obergrenze auch für Medium, Large und Ultra und ein Profilwechsel
|
||||||
|
zurück zu Fast bleibt möglich. Alte große Werkzeugausgaben werden ab 50.000 Token zunächst
|
||||||
ohne Modellaufruf bereinigt; `tail_mode: lean` hält nach der Kompression einen
|
ohne Modellaufruf bereinigt; `tail_mode: lean` hält nach der Kompression einen
|
||||||
kleinen, zusammenhängenden jüngsten Abschnitt. Dadurch sollen keine
|
kleinen, zusammenhängenden jüngsten Abschnitt. Dadurch sollen keine
|
||||||
mehrfachen minutenlangen Zusammenfassungen eines bereits weit überfüllten
|
mehrfachen minutenlangen Zusammenfassungen eines bereits weit überfüllten
|
||||||
@@ -136,6 +138,19 @@ Der Router übernimmt:
|
|||||||
- Agent-API: WireGuard-Port 8642 mit eigenem Bearer-Key
|
- Agent-API: WireGuard-Port 8642 mit eigenem Bearer-Key
|
||||||
- Profile: Fast 76,8K, Medium 160K, Large 192K, Ultra 262K und Uncensored
|
- Profile: Fast 76,8K, Medium 160K, Large 192K, Ultra 262K und Uncensored
|
||||||
80K; alle verwenden dieselben MCPs, Skills, Sprach- und Sicherheitsvorgaben
|
80K; alle verwenden dieselben MCPs, Skills, Sprach- und Sicherheitsvorgaben
|
||||||
|
- Profilübergreifende Latenzgrenzen: höchstens 8.192 Ausgabetoken je
|
||||||
|
Modellaufruf (sichtbare Antwort, Tool-Aufruf und verborgenes Denken
|
||||||
|
zusammen), Standard-Reasoning `low`; höhere Denkstufen bleiben pro Sitzung
|
||||||
|
über `/reasoning` wählbar.
|
||||||
|
- Automatische Sitzungstitel sind deaktiviert. Sie sind kosmetisch, erzeugten
|
||||||
|
aber auf dem einzelnen llama.cpp-Slot nach dem ersten Turn konkurrierende
|
||||||
|
Modellaufrufe und wiederholte 30-Sekunden-Timeouts.
|
||||||
|
- Hermes lädt als feste lokale Werkzeuge nur Web, Terminal, Dateien, Skills,
|
||||||
|
Aufgaben, Memory, Vision und TTS. Überschneidende große Built-ins wie
|
||||||
|
Browser-Automation, Session-Suche, Delegation und Clarify werden nicht in
|
||||||
|
jeden Prompt injiziert. Alle externen Athena-MCPs bleiben vollständig über
|
||||||
|
die verzögerte Werkzeugsuche verfügbar. Dadurch sank der feste Schema-Block
|
||||||
|
im Referenztest von 50.670 auf 27.556 Byte.
|
||||||
- Der verwaltete Skill `athena-operator` wird aus dem Repository in das
|
- Der verwaltete Skill `athena-operator` wird aus dem Repository in das
|
||||||
Standardprofil und alle fünf benannten Profile synchronisiert. Er enthält
|
Standardprofil und alle fünf benannten Profile synchronisiert. Er enthält
|
||||||
nur die verbindliche Arbeitslogik; Architektur und Ist-Zustand werden
|
nur die verbindliche Arbeitslogik; Architektur und Ist-Zustand werden
|
||||||
|
|||||||
Reference in New Issue
Block a user