4.6 KiB
Aktueller produktiver Laufzustand
Stand: 8. September 2026
Fotorestaurierung verworfen
Der versuchsweise HYPIR-SD2-Restaurationspfad wurde vollständig aus Router,
Compose und Hermes entfernt. HYPIR glättete beziehungsweise erfand beim realen
Testfoto Details; ein isolierter SeedVR2-7B-FP8-Test bewahrte das Motiv besser,
lieferte bei der starken Bewegungsunschärfe aber keinen ausreichenden
Qualitätsgewinn. Athena veröffentlicht deshalb kein Modell restauration und
Hermes besitzt keinen entsprechenden Skill mehr.
FLUX.2 Klein 9B bleibt für Bildgenerierung und kreative Referenzbild-Edits aktiv. Details und Abnahmekriterien stehen in IMAGE_RESTORATION.md.
FLUX.2 Klein 9B FP8 Beta
Die bisherige 4B-Bildinferenz wurde testweise durch FLUX.2 Klein 9B FP8 ersetzt. Athenas Profile Controller stellt dafür einen exklusiven Zwei-GPU-Pfad bereit:
- RTX 5080: 9B-FP8-Diffusionstransformer und VAE-Decoding
- RTX 3060: Qwen3-8B-Textencoder in NF4
- Qwen3-TTS und aktives llama.cpp-Profil werden für den Bildauftrag pausiert
- Piper bleibt währenddessen als CPU-TTS verfügbar
- nach Abschluss werden TTS und das vorherige Textprofil wiederhergestellt
Ein vollständiger Aufruf über Athenas OpenAI-kompatiblen Router wurde mit
HTTP 200, einem korrekt gespeicherten 1024×1024-PNG und anschließender
Wiederherstellung von Qwen3-TTS und qwen-fast erfolgreich geprüft. Ein
isolierter Vergleich ergab ungefähr 14,6 Sekunden Bildlaufzeit mit dem
GPU-Textencoder gegenüber 102,1 Sekunden mit CPU-Textencoder. Diese Werte sind
eine lokale Einzelmessung und keine allgemeine Modellgarantie.
Das Modell ist nicht kommerziell lizenziert. Die Bedingungen der beiden zugriffsbeschränkten Black-Forest-Labs-Repositories müssen vor dem Download akzeptiert werden. Details stehen in FLUX_9B_BETA.md.
Lokale Spracherkennung
Athena betreibt Whisper.cpp v1.9.1 mit ggml-small als CPU-Dienst. Der
Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt
/v1/audio/transcriptions; Standardsprache ist Deutsch. Modell und Download
bleiben im persistenten Docker-Volume whisper-data erhalten.
Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich
durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt
und wurde mit openclaw infer audio transcribe erfolgreich geprüft. Für den
lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt;
andere private Ziele werden dadurch nicht freigeschaltet.
Produktive llama.cpp-Runtime
Alle Textprofile verwenden llama.cpp Build 10781,
Commit c7bda030e7faee594dbe7550185e857351ad405d. Der Stand enthält die ab
Build 10751 verfügbare Korrektur für eine zwischenzeitliche
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
Build 10718, Commit 41ef91f7c8046087cdfbb276b79bff311ecf1c6d. Dessen lokales
Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt;
ein Rückfall erfordert daher einen Neubau dieses Commits.
Build 10781 wurde nach dem Bau produktiv verifiziert. Alle sechs Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden erfolgreich geprüft.
Qwen Medium: Vision-Projektor wieder aktiviert
qwen-medium läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
über --mmproj-offload --mmproj-device CUDA1 gezielt auf der RTX 3060 geladen.
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
beendet.
Dabei gilt ausdrücklich:
- Der Gesamtkontext bleibt bei 160.000 Tokens.
- Das Profil verwendet wieder einen Slot. Die getestete Zwei-Slot-Variante ist nicht produktiv.
- MTP / Speculative Decoding bleibt aktiviert; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben unverändert.
- Bildanalyse ist im Medium-Profil wieder verfügbar.
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
Referenz:
- https://github.com/ggml-org/llama.cpp/issues/19858
- https://github.com/ggml-org/llama.cpp/issues/21133
Separates bekanntes Problem
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.