Files
AI-Profile-Router/docs/CURRENT_RUNTIME_NOTES.md
T

109 lines
5.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Aktueller produktiver Laufzustand
Stand: 10. September 2026
## TRELLIS.2 3D-Studio
TRELLIS.2 4B läuft über trellis.cpp 0.6.0 als exklusiver Q8-Worker auf der
RTX 5080. Runtime und Q8-Gewichte liegen getrennt unter
`/data/trellis-studio` und `/data/models/trellis2-q8`; die Browseroberfläche
ist im WireGuard-Netz unter `http://192.168.1.212:8013` erreichbar. Ein realer
512er Ende-zu-Ende-Test erzeugte in 54,2 Sekunden ein gültiges 4,4-MB-GLB.
Für reguläre Qualitätsläufe ist `1024 · cascade` vorgesehen.
## Fotorestaurierung verworfen
Der versuchsweise HYPIR-SD2-Restaurationspfad wurde vollständig aus Router,
Compose und Hermes entfernt. HYPIR glättete beziehungsweise erfand beim realen
Testfoto Details; ein isolierter SeedVR2-7B-FP8-Test bewahrte das Motiv besser,
lieferte bei der starken Bewegungsunschärfe aber keinen ausreichenden
Qualitätsgewinn. Athena veröffentlicht deshalb kein Modell `restauration` und
Hermes besitzt keinen entsprechenden Skill mehr.
FLUX.2 Klein 9B bleibt für Bildgenerierung und kreative Referenzbild-Edits
aktiv. Details und Abnahmekriterien stehen in
[IMAGE_RESTORATION.md](IMAGE_RESTORATION.md).
## FLUX.2 Klein 9B FP8 Beta
Die bisherige 4B-Bildinferenz wurde testweise durch FLUX.2 Klein 9B FP8
ersetzt. Athenas Profile Controller stellt dafür einen exklusiven Zwei-GPU-Pfad
bereit:
- RTX 5080: 9B-FP8-Diffusionstransformer und VAE-Decoding
- RTX 3060: Qwen3-8B-Textencoder in NF4
- Qwen3-TTS und aktives llama.cpp-Profil werden für den Bildauftrag pausiert
- TTS ist währenddessen vorübergehend nicht verfügbar
- nach Abschluss werden TTS und das vorherige Textprofil wiederhergestellt
Ein vollständiger Aufruf über Athenas OpenAI-kompatiblen Router wurde mit
HTTP 200, einem korrekt gespeicherten 1024×1024-PNG und anschließender
Wiederherstellung von Qwen3-TTS und `qwen-fast` erfolgreich geprüft. Ein
isolierter Vergleich ergab ungefähr 14,6 Sekunden Bildlaufzeit mit dem
GPU-Textencoder gegenüber 102,1 Sekunden mit CPU-Textencoder. Diese Werte sind
eine lokale Einzelmessung und keine allgemeine Modellgarantie.
Das Modell ist nicht kommerziell lizenziert. Die Bedingungen der beiden
zugriffsbeschränkten Black-Forest-Labs-Repositories müssen vor dem Download
akzeptiert werden. Details stehen in [FLUX_9B_BETA.md](FLUX_9B_BETA.md).
## Lokale Spracherkennung
Athena betreibt Whisper.cpp v1.9.1 mit `ggml-small` als CPU-Dienst. Der
Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt
`/v1/audio/transcriptions`; Standardsprache ist Deutsch. Modell und Download
bleiben im persistenten Docker-Volume `whisper-data` erhalten.
Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich
durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt
und wurde mit `openclaw infer audio transcribe` erfolgreich geprüft. Für den
lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt;
andere private Ziele werden dadurch nicht freigeschaltet.
## Produktive llama.cpp-Runtime
Alle Textprofile verwenden llama.cpp Build 10781,
Commit `c7bda030e7faee594dbe7550185e857351ad405d`. Der Stand enthält die ab
Build 10751 verfügbare Korrektur für eine zwischenzeitliche
MTP-/KV-Cache-Initialisierungsregression. Der vorherige produktive Stand war
Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Dessen lokales
Fallback-Image wurde am 8. September 2026 beim gezielten Aufräumen entfernt;
ein Rückfall erfordert daher einen Neubau dieses Commits.
Build 10781 wurde nach dem Bau produktiv verifiziert. Alle fünf
Profildefinitionen verwenden dasselbe neue Image. Am 8. September lief Ultra
mit 262.144 Tokens Kontext gesund; MTP und eine lokale Textprobe wurden
erfolgreich geprüft.
## Qwen Medium: Vision-Projektor wieder aktiviert
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
beendet.
Dabei gilt ausdrücklich:
- Der Gesamtkontext bleibt bei **160.000 Tokens**.
- Das Profil verwendet wieder **einen Slot**. Die getestete Zwei-Slot-Variante
ist nicht produktiv.
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
unverändert.
- Bildanalyse ist im Medium-Profil wieder verfügbar.
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
Referenz:
- https://github.com/ggml-org/llama.cpp/issues/19858
- https://github.com/ggml-org/llama.cpp/issues/21133
## Separates bekanntes Problem
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.