Replace vision hotswap with native multimodal profiles
This commit is contained in:
+10
-12
@@ -36,7 +36,7 @@ Zielplattform.
|
||||
### Aktives Fast-Profil
|
||||
|
||||
- Qwen3.8-27B IQ4-MIX
|
||||
- Kontext 73.728
|
||||
- Kontext 76.800
|
||||
- vollständig auf CUDA0
|
||||
- Flash Attention
|
||||
- KV-Cache Q4_0 für K und V
|
||||
@@ -51,9 +51,9 @@ Zielplattform.
|
||||
|
||||
| Profil | Virtuelles Modell | Kontext | Besonderheit |
|
||||
|---|---|---:|---|
|
||||
| Fast | `qwen-fast` | 73.728 | IQ4-MIX, MTP2, vollständig GPU |
|
||||
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP |
|
||||
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN-Blöcke 0–11 auf CPU |
|
||||
| Fast | `qwen-fast` | 76.800 | IQ4-MIX, MTP2, vollständig GPU, CPU-mmproj |
|
||||
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP, CPU-mmproj |
|
||||
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN 0–11 auf CPU, CPU-mmproj |
|
||||
|
||||
## Router
|
||||
|
||||
@@ -69,7 +69,7 @@ Der Router übernimmt:
|
||||
- OpenAI-kompatibles Chat-Proxying und Streaming
|
||||
- virtuelle Modelle und automatische Profilumschaltung
|
||||
- Tool Calls
|
||||
- Vision-Hotswap mit Cache für Folgefragen
|
||||
- direkte integrierte Vision in allen Qwen-Profilen
|
||||
- FLUX-Hotswap zur Bildgenerierung
|
||||
- Whisper Speech-to-Text
|
||||
- XTTS Text-to-Speech
|
||||
@@ -79,15 +79,13 @@ Der Router übernimmt:
|
||||
|
||||
| Bereich | Referenz |
|
||||
|---|---|
|
||||
| Text-/Visionmodell | Qwen3.8-27B Q3_K_M |
|
||||
| Text-/Visionmodell | jeweils aktives Qwen3.8-27B-Profil |
|
||||
| Projektor | BF16-mmproj |
|
||||
| Kontext | 32.768 |
|
||||
| temporärer Port | 8086 |
|
||||
| maximale Ausgabe | 4.096 Tokens |
|
||||
| Speicherort des Projektors | System-RAM (`--no-mmproj-offload`) |
|
||||
| Kontext | entspricht Fast/Medium/Long |
|
||||
|
||||
Vision wird nicht dauerhaft parallel geladen. Der Router entlädt das
|
||||
Textprofil, analysiert das Bild und stellt danach das ursprüngliche Profil
|
||||
wieder her.
|
||||
Vision ist Bestandteil jedes Profils. Der Router prüft Bildgröße und URL,
|
||||
leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.
|
||||
|
||||
## Bildgenerierung
|
||||
|
||||
|
||||
@@ -21,7 +21,7 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
|
||||
|
||||
- [ ] llama.cpp entspricht dem festgelegten Commit
|
||||
- [ ] Modelldateien stimmen mit SHA256 überein
|
||||
- [ ] Fast startet mit 73.728 Kontext
|
||||
- [ ] Fast startet mit 76.800 Kontext
|
||||
- [ ] Medium startet mit 94.208 Kontext
|
||||
- [ ] Long startet mit 131.072 Kontext
|
||||
- [ ] GPU-/CPU-Verteilung entspricht den Profilen
|
||||
@@ -61,11 +61,11 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
|
||||
|
||||
## Phase E – Vision, Bild und Sprache
|
||||
|
||||
- [ ] neues Bild löst genau einen Vision-Hotswap aus
|
||||
- [ ] Folgefrage verwendet Cache und keinen zweiten Hotswap
|
||||
- [ ] Bilddaten werden vor dem Textmodell sanitisiert
|
||||
- [ ] neues Bild wird ohne Dienstneustart direkt vom aktiven Qwen analysiert
|
||||
- [ ] Folgefrage bleibt im multimodalen Verlauf und löst keinen Hotswap aus
|
||||
- [ ] Bilddaten werden größen- und URL-validiert
|
||||
- [ ] Remote-/private Bild-URL wird abgewiesen und übergroße Data-URL blockiert
|
||||
- [ ] Qwen-Profil wird nach Vision wiederhergestellt
|
||||
- [ ] llama.cpp-PID und aktives Profil bleiben bei Vision unverändert
|
||||
- [ ] FLUX erzeugt Standard- und High-Bild
|
||||
- [ ] Qwen-Profil wird nach FLUX wiederhergestellt
|
||||
- [ ] Whisper transkribiert deutsche und englische Testdatei
|
||||
|
||||
+2
-2
@@ -4,7 +4,7 @@
|
||||
|
||||
- Qwen3.8-27B IQ4-MIX und das getestete MTP2-Profil
|
||||
- IQ4_XS Pure für Medium
|
||||
- Q3-Vision-Modell und passender `mmproj`
|
||||
- BF16-`mmproj` für die integrierte Vision aller Qwen-Profile
|
||||
- festgeschriebener llama.cpp-Commit
|
||||
- Router, Whisper, XTTS und Websuche
|
||||
- spezialisierte MCPs nach Sicherheitsprofil
|
||||
@@ -33,7 +33,7 @@
|
||||
8. Medium und Long einzeln testen.
|
||||
9. Router installieren und Profilwechsel testen.
|
||||
10. Web, HA, ARR und Unraid nacheinander hinzufügen.
|
||||
11. STT, TTS und Vision ergänzen.
|
||||
11. STT, TTS und den Projektor für integrierte Vision ergänzen.
|
||||
12. Standardbenchmark und Sicherheitsprüfung ausführen.
|
||||
13. Erst danach Clients umstellen.
|
||||
|
||||
|
||||
+1
-1
@@ -4,7 +4,7 @@
|
||||
|
||||
| Profil | Virtuelles Modell | Kontext | Zweck |
|
||||
|---|---|---:|---|
|
||||
| Fast | `qwen-fast` | 73.728 | Alltag, Agenten, hohe Geschwindigkeit |
|
||||
| Fast | `qwen-fast` | 76.800 | Alltag, Agenten, hohe Geschwindigkeit, integrierte Vision |
|
||||
| Medium | `qwen-medium` | 94.208 | mehr Kontext, reine IQ4_XS-Variante |
|
||||
| Long | `qwen-long` | 131.072 | lange Hermes-/MCP-Sitzungen |
|
||||
|
||||
|
||||
@@ -31,7 +31,6 @@ Pflichtrollen:
|
||||
|
||||
- Qwen Fast/Long IQ4-MIX
|
||||
- Qwen Medium IQ4_XS Pure
|
||||
- Qwen Q3 Vision
|
||||
- BF16 Vision-Projektor
|
||||
- Whisper large-v3-turbo
|
||||
- FLUX.2 klein
|
||||
|
||||
Reference in New Issue
Block a user