Files
AI-Profile-Router/docs/CURRENT_RUNTIME_NOTES.md
T

2.8 KiB

Aktueller produktiver Laufzustand

Stand: 3. September 2026

Lokale Spracherkennung

Athena betreibt Whisper.cpp v1.9.1 mit large-v3-turbo als CPU-Dienst. Der Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt /v1/audio/transcriptions; Standardsprache ist Deutsch. Modell und Download bleiben im persistenten Docker-Volume whisper-data erhalten.

Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt und wurde mit openclaw infer audio transcribe erfolgreich geprüft. Für den lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt; andere private Ziele werden dadurch nicht freigeschaltet.

Produktive llama.cpp-Runtime

Aktualisiert am 12. September 2026: Alle fünf Textprofilcontainer verwenden llama.cpp Build 10930, Commit 56381e407c0ccfb3a6f71e668a27a901001d22ce.

Der tatsächliche vorherige Live-Build war 10872 (b31b71f3a076bfc4278daad442203a9c51c6e676), nicht der hier zuvor angegebene Build 10781. Er bleibt unter mike-ai/llama.cpp:b10872-pre-b10930 als Rückfallimage erhalten.

Das Update enthält den Fix für die Drafter-Position nach Bildeingaben #28715. Modellgewichte, Profilkontexte, GPU-Aufteilung, Vision, Slots und MTP-Parameter bleiben unverändert. Details und Testgrenzen stehen im Updateprotokoll.

Qwen Medium: Vision-Projektor wieder aktiviert

qwen-medium läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird über --mmproj-offload --mmproj-device CUDA1 gezielt auf der RTX 3060 geladen. Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch beendet.

Dabei gilt ausdrücklich:

  • Der Gesamtkontext bleibt bei 160.000 Tokens.
  • Das Profil verwendet wieder einen Slot. Die getestete Zwei-Slot-Variante ist nicht produktiv.
  • MTP / Speculative Decoding bleibt aktiviert; MTP wurde nicht entfernt.
  • Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert.
  • Bildanalyse ist im Medium-Profil wieder verfügbar.
  • Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird zugunsten der benötigten Vision-Funktion bewusst akzeptiert.

Referenz:

Separates bekanntes Problem

Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.