# Aktueller produktiver Laufzustand Stand: 8. September 2026 ## Fotorestaurierung verworfen Der versuchsweise HYPIR-SD2-Restaurationspfad wurde vollständig aus Router, Compose und Hermes entfernt. HYPIR glättete beziehungsweise erfand beim realen Testfoto Details; ein isolierter SeedVR2-7B-FP8-Test bewahrte das Motiv besser, lieferte bei der starken Bewegungsunschärfe aber keinen ausreichenden Qualitätsgewinn. Athena veröffentlicht deshalb kein Modell `restauration` und Hermes besitzt keinen entsprechenden Skill mehr. FLUX.2 Klein 9B bleibt für Bildgenerierung und kreative Referenzbild-Edits aktiv. Details und Abnahmekriterien stehen in [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md). ## FLUX.2 Klein 9B FP8 Beta Die bisherige 4B-Bildinferenz wurde testweise durch FLUX.2 Klein 9B FP8 ersetzt. Athenas Profile Controller stellt dafür einen exklusiven Zwei-GPU-Pfad bereit: - RTX 5080: 9B-FP8-Diffusionstransformer und VAE-Decoding - RTX 3060: Qwen3-8B-Textencoder in NF4 - Qwen3-TTS und aktives llama.cpp-Profil werden für den Bildauftrag pausiert - Piper bleibt währenddessen als CPU-TTS verfügbar - nach Abschluss werden TTS und das vorherige Textprofil wiederhergestellt Ein vollständiger Aufruf über Athenas OpenAI-kompatiblen Router wurde mit HTTP 200, einem korrekt gespeicherten 1024×1024-PNG und anschließender Wiederherstellung von Qwen3-TTS und `qwen-fast` erfolgreich geprüft. Ein isolierter Vergleich ergab ungefähr 14,6 Sekunden Bildlaufzeit mit dem GPU-Textencoder gegenüber 102,1 Sekunden mit CPU-Textencoder. Diese Werte sind eine lokale Einzelmessung und keine allgemeine Modellgarantie. Das Modell ist nicht kommerziell lizenziert. Die Bedingungen der beiden zugriffsbeschränkten Black-Forest-Labs-Repositories müssen vor dem Download akzeptiert werden. Details stehen in [FLUX_9B_BETA.md](FLUX_9B_BETA.md). ## Lokale Spracherkennung Athena betreibt Whisper.cpp v1.9.1 mit `ggml-small` als CPU-Dienst. Der Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt `/v1/audio/transcriptions`; Standardsprache ist Deutsch. Modell und Download bleiben im persistenten Docker-Volume `whisper-data` erhalten. Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt und wurde mit `openclaw infer audio transcribe` erfolgreich geprüft. Für den lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt; andere private Ziele werden dadurch nicht freigeschaltet. ## Produktive llama.cpp-Runtime Alle Textprofile verwenden llama.cpp Build 10781, Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab Build 10751 verfügbare Korrektur für eine zwischenzeitliche MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Dessen lokales Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt; ein Rückfall erfordert daher einen Neubau dieses Commits. Build 10781 wurde nach dem Bau produktiv verifiziert. Alle sechs Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden erfolgreich geprüft. ## Qwen Medium: Vision-Projektor wieder aktiviert `qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen. Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch beendet. Dabei gilt ausdrücklich: - Der Gesamtkontext bleibt bei **160.000 Tokens**. - Das Profil verwendet wieder **einen Slot**. Die getestete Zwei-Slot-Variante ist nicht produktiv. - **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt. - Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert. - Bildanalyse ist im Medium-Profil wieder verfügbar. - Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird zugunsten der benötigten Vision-Funktion bewusst akzeptiert. Referenz: - https://github.com/ggml-org/llama.cpp/issues/19858 - https://github.com/ggml-org/llama.cpp/issues/21133 ## Separates bekanntes Problem Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.