Add final Qwen3.8 runtime and uncensored profile
This commit is contained in:
@@ -21,6 +21,7 @@ Heimnetz / VPN-Clients
|
||||
+-- llama-fast --\
|
||||
+-- llama-medium > exakt einer aktiv
|
||||
+-- llama-large --/
|
||||
+-- llama-uncensored (80K, Abliterated, dual GPU)
|
||||
+-- llama-experimental
|
||||
+-- llama-ultra (256K, text-only, dual GPU)
|
||||
+-- Piper-TTS (CPU, nur intern)
|
||||
@@ -38,7 +39,7 @@ Heimnetz / VPN-Clients
|
||||
| WireGuard Gateway | VPN-Adresse, Port 8080/8081 | Tunnel und eng begrenzte TCP-Proxys |
|
||||
| Open WebUI | nur Docker-intern | Chat-Oberfläche |
|
||||
| Profile Router | nur Docker-intern | OpenAI-API und Profilwahl |
|
||||
| Profile Controller | nein | startet ausschließlich vier bekannte Profile |
|
||||
| Profile Controller | nein | startet ausschließlich fest erlaubte Profile |
|
||||
| llama.cpp Profile | nein | Inferenz, Tool Calling, integrierte Vision |
|
||||
| Piper | nein | lokale deutsche Text-to-Speech-Ausgabe |
|
||||
| MCP-Tool-Stack | nein | voneinander getrennte Werkzeugbereiche |
|
||||
@@ -46,7 +47,7 @@ Heimnetz / VPN-Clients
|
||||
|
||||
Nur der Profile Controller erhält den Docker-Socket. Der Router erhält weder
|
||||
Socket noch Shell-Zugriff und kann dem Controller nur `fast`, `medium`, `large`,
|
||||
`ultra` oder `experimental` übergeben. Die llama-Container laufen ohne UI,
|
||||
`ultra`, `uncensored` oder `experimental` übergeben. Die llama-Container laufen ohne UI,
|
||||
Capabilities und Schreibzugriff auf die Modelldateien.
|
||||
|
||||
## Profilprinzip
|
||||
@@ -64,18 +65,20 @@ halten.
|
||||
| medium | 160.000 Kontext, Pure, 90:10, MTP3 | Standardprofil |
|
||||
| large | 192.000 Kontext, Pure, 86:14, MTP3 | große Agenten-/MCP-Sitzungen |
|
||||
| ultra | 262.144 Kontext, Pure, 80:20, MTP2 | maximaler Textkontext |
|
||||
| uncensored | 80.000 Kontext, Abliterated Q4_K_M, 90:10, MTP2 | weniger Verweigerungen bei unveränderten Tool-Grenzen |
|
||||
| experimental | 76.800 Kontext | isolierte Tests ohne Produktion zu ändern |
|
||||
|
||||
Diese Matrix wurde auf RTX 5080 und RTX 3060 gemessen und ist bis zu einer
|
||||
bewussten Neubewertung der verbindliche Produktionsstandard.
|
||||
|
||||
Bei Fast, Medium und Large bleibt das Sprachmodell wie in der Tabelle
|
||||
Bei Fast, Medium, Large und Uncensored bleibt das Sprachmodell wie in der Tabelle
|
||||
verteilt, während `MTMD_BACKEND_DEVICE=CUDA1` den vollständigen
|
||||
Multimodal-Projektor auf die RTX 3060 legt. Ein reproduzierbarer Test mit einem
|
||||
synthetischen Bild (1024×768, 835 Eingabetoken) senkte die Bild-/Promptzeit im
|
||||
Medium-Profil von 23,17 auf 1,68 Sekunden und die gesamte Anfrage von 24,96
|
||||
auf 2,94 Sekunden. Der Projektor belegte dabei rund 1,1 GiB zusätzlichen VRAM
|
||||
auf der 3060. Ultra bleibt für maximalen Kontext bewusst text-only.
|
||||
auf der 3060. Das Uncensored-Profil nutzt seinen passenden eigenen Projektor.
|
||||
Ultra bleibt für maximalen Kontext bewusst text-only.
|
||||
|
||||
## Netzwerk
|
||||
|
||||
|
||||
Reference in New Issue
Block a user