- Automatische Vision-Orchestrierung: temporärer Q3-Vision-Server (llama.cpp + mmproj) analysiert Bilder, Hauptmodell (Fast/Medium/Long) erzeugt die finale Antwort. Zentrale GPU-Lock (Ausschluss mit FLUX), Drain, Timeouts, Restore in jedem Fehlerfall. - Vision-Analyse wird als interne User-Message injiziert (nie als Assistant-Turn in Open WebUI). - Analyse-Cache (LRU, keyed by Bild-Hash): Folgefragen triggern keinen neuen Hotswap. - Sanitize: alle Bild-Parts (image_url/Base64) werden bei jedem Request durch die gecachte Analyse ersetzt, Bilddaten entfernt - das Nicht-Vision-Hauptmodell bekommt keine Bilder mehr (kein image input is not supported). - /v1/streams/lookup fail-fast während Vision-Swap; /props-Regression behoben; POST /vision/test für direkten Test. - systemd-Unit: VISION_*-Umgebungsvariablen; README dokumentiert Vision.
40 lines
1.6 KiB
Desktop File
40 lines
1.6 KiB
Desktop File
[Unit]
|
|
Description=Mike AI Profile Router (OpenAI-kompatibler Proxy + Bild-Orchestrierung, Port 8081)
|
|
After=network-online.target
|
|
Wants=network-online.target
|
|
|
|
[Service]
|
|
Type=simple
|
|
ExecStart=/opt/mike-ai/ai-profile-router/venv/bin/python /opt/mike-ai/ai-profile-router/ai_profile_router.py
|
|
Restart=on-failure
|
|
RestartSec=3
|
|
Environment=ROUTER_HOST=0.0.0.0
|
|
Environment=ROUTER_PORT=8081
|
|
Environment=UPSTREAM_URL=http://127.0.0.1:8080
|
|
Environment=PROFILE_SCRIPT=/usr/local/bin/llama-profile
|
|
Environment=PROFILE_DIR=/etc/systemd/system/mike-ai-llama-ui.service.d
|
|
Environment=SWITCH_TIMEOUT=600
|
|
Environment=REQUEST_TIMEOUT=600
|
|
Environment=LLAMA_SERVICE=mike-ai-llama-ui.service
|
|
Environment=IMAGE_WORKER=/opt/mike-ai/ai-profile-router/image_worker.py
|
|
Environment=IMAGE_PYTHON=/opt/mike-ai/ai-profile-router/venv/bin/python
|
|
Environment=IMAGE_DIR=/opt/mike-ai/ai-profile-router/images
|
|
Environment=IMAGE_WORKER_LOG=/opt/mike-ai/ai-profile-router/worker.log
|
|
Environment=IMAGE_GEN_TIMEOUT=600
|
|
Environment=IMAGE_VRAM_FREE_TIMEOUT=120
|
|
Environment=LLAMA_SERVER_BIN=/opt/mike-ai/llama.cpp-nvfp4/build/bin/llama-server
|
|
Environment=VISION_MODEL=/opt/mike-ai/models/qwen3.8-27b/Qwen3.8-27B-Q3_K_M.gguf
|
|
Environment=VISION_MMPROJ=/opt/mike-ai/models/qwen3.8-27b-nvfp4/mmproj-BF16.gguf
|
|
Environment=VISION_CTX=32768
|
|
Environment=VISION_PORT=8086
|
|
Environment=VISION_LOAD_TIMEOUT=300
|
|
Environment=VISION_INFER_TIMEOUT=300
|
|
Environment=VISION_UNLOAD_TIMEOUT=120
|
|
Environment=VISION_MAX_TOKENS=4096
|
|
Environment=VISION_LOG=/opt/mike-ai/ai-profile-router/vision_server.log
|
|
NoNewPrivileges=true
|
|
PrivateTmp=true
|
|
|
|
[Install]
|
|
WantedBy=multi-user.target
|