Document Hermes latency budget
This commit is contained in:
@@ -96,8 +96,10 @@ Der Router übernimmt:
|
||||
|
||||
## Hermes Agent
|
||||
|
||||
- Kontextkompression läuft frühzeitig bei 65 Prozent des jeweiligen
|
||||
Profilfensters. Alte große Werkzeugausgaben werden ab 50.000 Token zunächst
|
||||
- Kontextkompression läuft spätestens bei 60.000 Token; die relative
|
||||
65-Prozent-Grenze greift nur, wenn sie noch früher erreicht wird. Damit gilt
|
||||
dieselbe Obergrenze auch für Medium, Large und Ultra und ein Profilwechsel
|
||||
zurück zu Fast bleibt möglich. Alte große Werkzeugausgaben werden ab 50.000 Token zunächst
|
||||
ohne Modellaufruf bereinigt; `tail_mode: lean` hält nach der Kompression einen
|
||||
kleinen, zusammenhängenden jüngsten Abschnitt. Dadurch sollen keine
|
||||
mehrfachen minutenlangen Zusammenfassungen eines bereits weit überfüllten
|
||||
@@ -136,6 +138,19 @@ Der Router übernimmt:
|
||||
- Agent-API: WireGuard-Port 8642 mit eigenem Bearer-Key
|
||||
- Profile: Fast 76,8K, Medium 160K, Large 192K, Ultra 262K und Uncensored
|
||||
80K; alle verwenden dieselben MCPs, Skills, Sprach- und Sicherheitsvorgaben
|
||||
- Profilübergreifende Latenzgrenzen: höchstens 8.192 Ausgabetoken je
|
||||
Modellaufruf (sichtbare Antwort, Tool-Aufruf und verborgenes Denken
|
||||
zusammen), Standard-Reasoning `low`; höhere Denkstufen bleiben pro Sitzung
|
||||
über `/reasoning` wählbar.
|
||||
- Automatische Sitzungstitel sind deaktiviert. Sie sind kosmetisch, erzeugten
|
||||
aber auf dem einzelnen llama.cpp-Slot nach dem ersten Turn konkurrierende
|
||||
Modellaufrufe und wiederholte 30-Sekunden-Timeouts.
|
||||
- Hermes lädt als feste lokale Werkzeuge nur Web, Terminal, Dateien, Skills,
|
||||
Aufgaben, Memory, Vision und TTS. Überschneidende große Built-ins wie
|
||||
Browser-Automation, Session-Suche, Delegation und Clarify werden nicht in
|
||||
jeden Prompt injiziert. Alle externen Athena-MCPs bleiben vollständig über
|
||||
die verzögerte Werkzeugsuche verfügbar. Dadurch sank der feste Schema-Block
|
||||
im Referenztest von 50.670 auf 27.556 Byte.
|
||||
- Der verwaltete Skill `athena-operator` wird aus dem Repository in das
|
||||
Standardprofil und alle fünf benannten Profile synchronisiert. Er enthält
|
||||
nur die verbindliche Arbeitslogik; Architektur und Ist-Zustand werden
|
||||
|
||||
Reference in New Issue
Block a user