Files
AI-Profile-Router/docs/CURRENT_RUNTIME_NOTES.md
T

66 lines
2.8 KiB
Markdown

# Aktueller produktiver Laufzustand
Stand: 3. September 2026
## Lokale Spracherkennung
Athena betreibt Whisper.cpp v1.9.1 mit `large-v3-turbo` als CPU-Dienst. Der
Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt
`/v1/audio/transcriptions`; Standardsprache ist Deutsch. Modell und Download
bleiben im persistenten Docker-Volume `whisper-data` erhalten.
Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich
durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt
und wurde mit `openclaw infer audio transcribe` erfolgreich geprüft. Für den
lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt;
andere private Ziele werden dadurch nicht freigeschaltet.
## Produktive llama.cpp-Runtime
Aktualisiert am 12. September 2026: Alle fünf Textprofilcontainer verwenden
llama.cpp **Build 10930**, Commit
`56381e407c0ccfb3a6f71e668a27a901001d22ce`.
Der tatsächliche vorherige Live-Build war 10872
(`b31b71f3a076bfc4278daad442203a9c51c6e676`), nicht der hier zuvor
angegebene Build 10781. Er bleibt unter
`mike-ai/llama.cpp:b10872-pre-b10930` als Rückfallimage erhalten.
Das Update enthält den Fix für die Drafter-Position nach Bildeingaben
[#28715](https://github.com/ggml-org/llama.cpp/pull/28715). Modellgewichte,
Profilkontexte, GPU-Aufteilung, Vision, Slots und MTP-Parameter bleiben
unverändert. Details und Testgrenzen stehen im
[Updateprotokoll](LLAMA_B10930_UPDATE_20260912.md).
## Qwen Medium: Vision-Projektor wieder aktiviert
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
beendet.
Dabei gilt ausdrücklich:
- Der Gesamtkontext bleibt bei **160.000 Tokens**.
- Das Profil verwendet wieder **einen Slot**. Die getestete Zwei-Slot-Variante
ist nicht produktiv.
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
unverändert.
- Bildanalyse ist im Medium-Profil wieder verfügbar.
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
Referenz:
- https://github.com/ggml-org/llama.cpp/issues/19858
- https://github.com/ggml-org/llama.cpp/issues/21133
## Separates bekanntes Problem
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.