109 lines
5.0 KiB
Markdown
109 lines
5.0 KiB
Markdown
# Aktueller produktiver Laufzustand
|
||
|
||
Stand: 10. September 2026
|
||
|
||
## TRELLIS.2 3D-Studio
|
||
|
||
TRELLIS.2 4B läuft über trellis.cpp 0.6.0 als exklusiver Q8-Worker auf der
|
||
RTX 5080. Runtime und Q8-Gewichte liegen getrennt unter
|
||
`/data/trellis-studio` und `/data/models/trellis2-q8`; die Browseroberfläche
|
||
ist im WireGuard-Netz unter `http://192.168.1.212:8013` erreichbar. Ein realer
|
||
512er Ende-zu-Ende-Test erzeugte in 54,2 Sekunden ein gültiges 4,4-MB-GLB.
|
||
Für reguläre Qualitätsläufe ist `1024 · cascade` vorgesehen.
|
||
|
||
## Fotorestaurierung verworfen
|
||
|
||
Der versuchsweise HYPIR-SD2-Restaurationspfad wurde vollständig aus Router,
|
||
Compose und Hermes entfernt. HYPIR glättete beziehungsweise erfand beim realen
|
||
Testfoto Details; ein isolierter SeedVR2-7B-FP8-Test bewahrte das Motiv besser,
|
||
lieferte bei der starken Bewegungsunschärfe aber keinen ausreichenden
|
||
Qualitätsgewinn. Athena veröffentlicht deshalb kein Modell `restauration` und
|
||
Hermes besitzt keinen entsprechenden Skill mehr.
|
||
|
||
FLUX.2 Klein 9B bleibt für Bildgenerierung und kreative Referenzbild-Edits
|
||
aktiv. Details und Abnahmekriterien stehen in
|
||
[IMAGE_RESTORATION.md](IMAGE_RESTORATION.md).
|
||
|
||
## FLUX.2 Klein 9B FP8 Beta
|
||
|
||
Die bisherige 4B-Bildinferenz wurde testweise durch FLUX.2 Klein 9B FP8
|
||
ersetzt. Athenas Profile Controller stellt dafür einen exklusiven Zwei-GPU-Pfad
|
||
bereit:
|
||
|
||
- RTX 5080: 9B-FP8-Diffusionstransformer und VAE-Decoding
|
||
- RTX 3060: Qwen3-8B-Textencoder in NF4
|
||
- Qwen3-TTS und aktives llama.cpp-Profil werden für den Bildauftrag pausiert
|
||
- TTS ist währenddessen vorübergehend nicht verfügbar
|
||
- nach Abschluss werden TTS und das vorherige Textprofil wiederhergestellt
|
||
|
||
Ein vollständiger Aufruf über Athenas OpenAI-kompatiblen Router wurde mit
|
||
HTTP 200, einem korrekt gespeicherten 1024×1024-PNG und anschließender
|
||
Wiederherstellung von Qwen3-TTS und `qwen-fast` erfolgreich geprüft. Ein
|
||
isolierter Vergleich ergab ungefähr 14,6 Sekunden Bildlaufzeit mit dem
|
||
GPU-Textencoder gegenüber 102,1 Sekunden mit CPU-Textencoder. Diese Werte sind
|
||
eine lokale Einzelmessung und keine allgemeine Modellgarantie.
|
||
|
||
Das Modell ist nicht kommerziell lizenziert. Die Bedingungen der beiden
|
||
zugriffsbeschränkten Black-Forest-Labs-Repositories müssen vor dem Download
|
||
akzeptiert werden. Details stehen in [FLUX_9B_BETA.md](FLUX_9B_BETA.md).
|
||
|
||
## Lokale Spracherkennung
|
||
|
||
Athena betreibt Whisper.cpp v1.9.1 mit `ggml-small` als CPU-Dienst. Der
|
||
Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt
|
||
`/v1/audio/transcriptions`; Standardsprache ist Deutsch. Modell und Download
|
||
bleiben im persistenten Docker-Volume `whisper-data` erhalten.
|
||
|
||
Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich
|
||
durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt
|
||
und wurde mit `openclaw infer audio transcribe` erfolgreich geprüft. Für den
|
||
lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt;
|
||
andere private Ziele werden dadurch nicht freigeschaltet.
|
||
|
||
## Produktive llama.cpp-Runtime
|
||
|
||
Alle Textprofile verwenden llama.cpp Build 10781,
|
||
Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab
|
||
Build 10751 verfügbare Korrektur für eine zwischenzeitliche
|
||
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
|
||
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Dessen lokales
|
||
Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt;
|
||
ein Rückfall erfordert daher einen Neubau dieses Commits.
|
||
|
||
Build 10781 wurde nach dem Bau produktiv verifiziert. Alle fünf
|
||
Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra
|
||
mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden
|
||
erfolgreich geprüft.
|
||
|
||
## Qwen Medium: Vision-Projektor wieder aktiviert
|
||
|
||
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
|
||
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
|
||
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
|
||
beendet.
|
||
|
||
Dabei gilt ausdrücklich:
|
||
|
||
- Der Gesamtkontext bleibt bei **160.000 Tokens**.
|
||
- Das Profil verwendet wieder **einen Slot**. Die getestete Zwei-Slot-Variante
|
||
ist nicht produktiv.
|
||
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
|
||
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
|
||
unverändert.
|
||
- Bildanalyse ist im Medium-Profil wieder verfügbar.
|
||
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
|
||
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
|
||
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
|
||
|
||
Referenz:
|
||
|
||
- https://github.com/ggml-org/llama.cpp/issues/19858
|
||
- https://github.com/ggml-org/llama.cpp/issues/21133
|
||
|
||
## Separates bekanntes Problem
|
||
|
||
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
|
||
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
|
||
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
|
||
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
|