Replace vision hotswap with native multimodal profiles

This commit is contained in:
Mikei386
2026-08-20 14:24:56 +02:00
parent 8a45a0d851
commit cb07779f5a
19 changed files with 169 additions and 719 deletions
+10 -12
View File
@@ -36,7 +36,7 @@ Zielplattform.
### Aktives Fast-Profil
- Qwen3.8-27B IQ4-MIX
- Kontext 73.728
- Kontext 76.800
- vollständig auf CUDA0
- Flash Attention
- KV-Cache Q4_0 für K und V
@@ -51,9 +51,9 @@ Zielplattform.
| Profil | Virtuelles Modell | Kontext | Besonderheit |
|---|---|---:|---|
| Fast | `qwen-fast` | 73.728 | IQ4-MIX, MTP2, vollständig GPU |
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP |
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN-Blöcke 0–11 auf CPU |
| Fast | `qwen-fast` | 76.800 | IQ4-MIX, MTP2, vollständig GPU, CPU-mmproj |
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP, CPU-mmproj |
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN 0–11 auf CPU, CPU-mmproj |
## Router
@@ -69,7 +69,7 @@ Der Router übernimmt:
- OpenAI-kompatibles Chat-Proxying und Streaming
- virtuelle Modelle und automatische Profilumschaltung
- Tool Calls
- Vision-Hotswap mit Cache für Folgefragen
- direkte integrierte Vision in allen Qwen-Profilen
- FLUX-Hotswap zur Bildgenerierung
- Whisper Speech-to-Text
- XTTS Text-to-Speech
@@ -79,15 +79,13 @@ Der Router übernimmt:
| Bereich | Referenz |
|---|---|
| Text-/Visionmodell | Qwen3.8-27B Q3_K_M |
| Text-/Visionmodell | jeweils aktives Qwen3.8-27B-Profil |
| Projektor | BF16-mmproj |
| Kontext | 32.768 |
| temporärer Port | 8086 |
| maximale Ausgabe | 4.096 Tokens |
| Speicherort des Projektors | System-RAM (`--no-mmproj-offload`) |
| Kontext | entspricht Fast/Medium/Long |
Vision wird nicht dauerhaft parallel geladen. Der Router entlädt das
Textprofil, analysiert das Bild und stellt danach das ursprüngliche Profil
wieder her.
Vision ist Bestandteil jedes Profils. Der Router prüft Bildgröße und URL,
leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.
## Bildgenerierung
+5 -5
View File
@@ -21,7 +21,7 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
- [ ] llama.cpp entspricht dem festgelegten Commit
- [ ] Modelldateien stimmen mit SHA256 überein
- [ ] Fast startet mit 73.728 Kontext
- [ ] Fast startet mit 76.800 Kontext
- [ ] Medium startet mit 94.208 Kontext
- [ ] Long startet mit 131.072 Kontext
- [ ] GPU-/CPU-Verteilung entspricht den Profilen
@@ -61,11 +61,11 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
## Phase E – Vision, Bild und Sprache
- [ ] neues Bild löst genau einen Vision-Hotswap aus
- [ ] Folgefrage verwendet Cache und keinen zweiten Hotswap
- [ ] Bilddaten werden vor dem Textmodell sanitisiert
- [ ] neues Bild wird ohne Dienstneustart direkt vom aktiven Qwen analysiert
- [ ] Folgefrage bleibt im multimodalen Verlauf und löst keinen Hotswap aus
- [ ] Bilddaten werden größen- und URL-validiert
- [ ] Remote-/private Bild-URL wird abgewiesen und übergroße Data-URL blockiert
- [ ] Qwen-Profil wird nach Vision wiederhergestellt
- [ ] llama.cpp-PID und aktives Profil bleiben bei Vision unverändert
- [ ] FLUX erzeugt Standard- und High-Bild
- [ ] Qwen-Profil wird nach FLUX wiederhergestellt
- [ ] Whisper transkribiert deutsche und englische Testdatei
+2 -2
View File
@@ -4,7 +4,7 @@
- Qwen3.8-27B IQ4-MIX und das getestete MTP2-Profil
- IQ4_XS Pure für Medium
- Q3-Vision-Modell und passender `mmproj`
- BF16-`mmproj` für die integrierte Vision aller Qwen-Profile
- festgeschriebener llama.cpp-Commit
- Router, Whisper, XTTS und Websuche
- spezialisierte MCPs nach Sicherheitsprofil
@@ -33,7 +33,7 @@
8. Medium und Long einzeln testen.
9. Router installieren und Profilwechsel testen.
10. Web, HA, ARR und Unraid nacheinander hinzufügen.
11. STT, TTS und Vision ergänzen.
11. STT, TTS und den Projektor für integrierte Vision ergänzen.
12. Standardbenchmark und Sicherheitsprüfung ausführen.
13. Erst danach Clients umstellen.
+1 -1
View File
@@ -4,7 +4,7 @@
| Profil | Virtuelles Modell | Kontext | Zweck |
|---|---|---:|---|
| Fast | `qwen-fast` | 73.728 | Alltag, Agenten, hohe Geschwindigkeit |
| Fast | `qwen-fast` | 76.800 | Alltag, Agenten, hohe Geschwindigkeit, integrierte Vision |
| Medium | `qwen-medium` | 94.208 | mehr Kontext, reine IQ4_XS-Variante |
| Long | `qwen-long` | 131.072 | lange Hermes-/MCP-Sitzungen |
-1
View File
@@ -31,7 +31,6 @@ Pflichtrollen:
- Qwen Fast/Long IQ4-MIX
- Qwen Medium IQ4_XS Pure
- Qwen Q3 Vision
- BF16 Vision-Projektor
- Whisper large-v3-turbo
- FLUX.2 klein