From a9bd832c71d4426491721d6d65a362aa9791b703 Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Tue, 25 Aug 2026 18:07:28 +0200 Subject: [PATCH] Document Hermes latency budget --- docs/CURRENT_REFERENCE.md | 19 +++++++++++++++++-- 1 file changed, 17 insertions(+), 2 deletions(-) diff --git a/docs/CURRENT_REFERENCE.md b/docs/CURRENT_REFERENCE.md index 9a5cee3..a8f6816 100644 --- a/docs/CURRENT_REFERENCE.md +++ b/docs/CURRENT_REFERENCE.md @@ -96,8 +96,10 @@ Der Router übernimmt: ## Hermes Agent -- Kontextkompression läuft frühzeitig bei 65 Prozent des jeweiligen - Profilfensters. Alte große Werkzeugausgaben werden ab 50.000 Token zunächst +- Kontextkompression läuft spätestens bei 60.000 Token; die relative + 65-Prozent-Grenze greift nur, wenn sie noch früher erreicht wird. Damit gilt + dieselbe Obergrenze auch für Medium, Large und Ultra und ein Profilwechsel + zurück zu Fast bleibt möglich. Alte große Werkzeugausgaben werden ab 50.000 Token zunächst ohne Modellaufruf bereinigt; `tail_mode: lean` hält nach der Kompression einen kleinen, zusammenhängenden jüngsten Abschnitt. Dadurch sollen keine mehrfachen minutenlangen Zusammenfassungen eines bereits weit überfüllten @@ -136,6 +138,19 @@ Der Router übernimmt: - Agent-API: WireGuard-Port 8642 mit eigenem Bearer-Key - Profile: Fast 76,8K, Medium 160K, Large 192K, Ultra 262K und Uncensored 80K; alle verwenden dieselben MCPs, Skills, Sprach- und Sicherheitsvorgaben +- Profilübergreifende Latenzgrenzen: höchstens 8.192 Ausgabetoken je + Modellaufruf (sichtbare Antwort, Tool-Aufruf und verborgenes Denken + zusammen), Standard-Reasoning `low`; höhere Denkstufen bleiben pro Sitzung + über `/reasoning` wählbar. +- Automatische Sitzungstitel sind deaktiviert. Sie sind kosmetisch, erzeugten + aber auf dem einzelnen llama.cpp-Slot nach dem ersten Turn konkurrierende + Modellaufrufe und wiederholte 30-Sekunden-Timeouts. +- Hermes lädt als feste lokale Werkzeuge nur Web, Terminal, Dateien, Skills, + Aufgaben, Memory, Vision und TTS. Überschneidende große Built-ins wie + Browser-Automation, Session-Suche, Delegation und Clarify werden nicht in + jeden Prompt injiziert. Alle externen Athena-MCPs bleiben vollständig über + die verzögerte Werkzeugsuche verfügbar. Dadurch sank der feste Schema-Block + im Referenztest von 50.670 auf 27.556 Byte. - Der verwaltete Skill `athena-operator` wird aus dem Repository in das Standardprofil und alle fünf benannten Profile synchronisiert. Er enthält nur die verbindliche Arbeitslogik; Architektur und Ist-Zustand werden