- Automatische Vision-Orchestrierung: temporärer Q3-Vision-Server
(llama.cpp + mmproj) analysiert Bilder, Hauptmodell (Fast/Medium/Long)
erzeugt die finale Antwort. Zentrale GPU-Lock (Ausschluss mit FLUX),
Drain, Timeouts, Restore in jedem Fehlerfall.
- Vision-Analyse wird als interne User-Message injiziert (nie als
Assistant-Turn in Open WebUI).
- Analyse-Cache (LRU, keyed by Bild-Hash): Folgefragen triggern keinen
neuen Hotswap.
- Sanitize: alle Bild-Parts (image_url/Base64) werden bei jedem Request
durch die gecachte Analyse ersetzt, Bilddaten entfernt - das
Nicht-Vision-Hauptmodell bekommt keine Bilder mehr (kein
image input is not supported).
- /v1/streams/lookup fail-fast während Vision-Swap; /props-Regression
behoben; POST /vision/test für direkten Test.
- systemd-Unit: VISION_*-Umgebungsvariablen; README dokumentiert Vision.