2.8 KiB
Aktueller produktiver Laufzustand
Stand: 3. September 2026
Lokale Spracherkennung
Athena betreibt Whisper.cpp v1.9.1 mit large-v3-turbo als CPU-Dienst. Der
Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt
/v1/audio/transcriptions; Standardsprache ist Deutsch. Modell und Download
bleiben im persistenten Docker-Volume whisper-data erhalten.
Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich
durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt
und wurde mit openclaw infer audio transcribe erfolgreich geprüft. Für den
lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt;
andere private Ziele werden dadurch nicht freigeschaltet.
Produktive llama.cpp-Runtime
Aktualisiert am 12. September 2026: Alle fünf Textprofilcontainer verwenden
llama.cpp Build 10930, Commit
56381e407c0ccfb3a6f71e668a27a901001d22ce.
Der tatsächliche vorherige Live-Build war 10872
(b31b71f3a076bfc4278daad442203a9c51c6e676), nicht der hier zuvor
angegebene Build 10781. Er bleibt unter
mike-ai/llama.cpp:b10872-pre-b10930 als Rückfallimage erhalten.
Das Update enthält den Fix für die Drafter-Position nach Bildeingaben #28715. Modellgewichte, Profilkontexte, GPU-Aufteilung, Vision, Slots und MTP-Parameter bleiben unverändert. Details und Testgrenzen stehen im Updateprotokoll.
Qwen Medium: Vision-Projektor wieder aktiviert
qwen-medium läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
über --mmproj-offload --mmproj-device CUDA1 gezielt auf der RTX 3060 geladen.
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
beendet.
Dabei gilt ausdrücklich:
- Der Gesamtkontext bleibt bei 160.000 Tokens.
- Das Profil verwendet wieder einen Slot. Die getestete Zwei-Slot-Variante ist nicht produktiv.
- MTP / Speculative Decoding bleibt aktiviert; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert.
- Bildanalyse ist im Medium-Profil wieder verfügbar.
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
Referenz:
- https://github.com/ggml-org/llama.cpp/issues/19858
- https://github.com/ggml-org/llama.cpp/issues/21133
Separates bekanntes Problem
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.