# Aktueller produktiver Laufzustand Stand: 7. September 2026 ## FLUX.2 Klein 9B FP8 Beta Die bisherige 4B-Bildinferenz wurde testweise durch FLUX.2 Klein 9B FP8 ersetzt. Athenas Profile Controller stellt dafür einen exklusiven Zwei-GPU-Pfad bereit: - RTX 5080: 9B-FP8-Diffusionstransformer und VAE-Decoding - RTX 3060: Qwen3-8B-Textencoder in NF4 - Qwen3-TTS und aktives llama.cpp-Profil werden für den Bildauftrag pausiert - Piper bleibt währenddessen als CPU-TTS verfügbar - nach Abschluss werden TTS und das vorherige Textprofil wiederhergestellt Ein vollständiger Aufruf über Athenas OpenAI-kompatiblen Router wurde mit HTTP 200, einem korrekt gespeicherten 1024×1024-PNG und anschließender Wiederherstellung von Qwen3-TTS und `qwen-fast` erfolgreich geprüft. Ein isolierter Vergleich ergab ungefähr 14,6 Sekunden Bildlaufzeit mit dem GPU-Textencoder gegenüber 102,1 Sekunden mit CPU-Textencoder. Diese Werte sind eine lokale Einzelmessung und keine allgemeine Modellgarantie. Das Modell ist nicht kommerziell lizenziert. Die Bedingungen der beiden zugriffsbeschränkten Black-Forest-Labs-Repositories müssen vor dem Download akzeptiert werden. Details stehen in [FLUX_9B_BETA.md](FLUX_9B_BETA.md). ## Lokale Spracherkennung Athena betreibt Whisper.cpp v1.9.1 mit `large-v3-turbo` als CPU-Dienst. Der Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt `/v1/audio/transcriptions`; Standardsprache ist Deutsch. Modell und Download bleiben im persistenten Docker-Volume `whisper-data` erhalten. Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt und wurde mit `openclaw infer audio transcribe` erfolgreich geprüft. Für den lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt; andere private Ziele werden dadurch nicht freigeschaltet. ## Produktive llama.cpp-Runtime Alle Textprofile verwenden llama.cpp Build 10781, Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab Build 10751 verfügbare Korrektur für eine zwischenzeitliche MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`, und bleibt über das alte lokale Image `mike-ai/llama.cpp:b10718-fallback` als unmittelbarer Rückfallpunkt erhalten. Build 10781 wurde nach dem Bau produktiv verifiziert: Alle fünf Profilcontainer verwenden dasselbe neue Image, ausschließlich Medium läuft, Qwen Medium ist mit 160.000 Tokens Kontext gesund, der MTP-Kontext wurde erfolgreich initialisiert, der Vision-Projektor geladen und eine lokale Textprobe korrekt beantwortet. ## Qwen Medium: Vision-Projektor wieder aktiviert `qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen. Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch beendet. Dabei gilt ausdrücklich: - Der Gesamtkontext bleibt bei **160.000 Tokens**. - Das Profil verwendet wieder **einen Slot**. Die getestete Zwei-Slot-Variante ist nicht produktiv. - **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt. - Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert. - Bildanalyse ist im Medium-Profil wieder verfügbar. - Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird zugunsten der benötigten Vision-Funktion bewusst akzeptiert. Referenz: - https://github.com/ggml-org/llama.cpp/issues/19858 - https://github.com/ggml-org/llama.cpp/issues/21133 ## Separates bekanntes Problem Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.