Add final Qwen3.8 runtime and uncensored profile

This commit is contained in:
Mikei386
2026-08-23 00:10:53 +02:00
parent 1a9d94d22f
commit 2ef894160a
57 changed files with 10089 additions and 54 deletions
+5 -4
View File
@@ -8,11 +8,12 @@ WireGuard-Isolation.
- Debian 13 als schlanker GPU-Host
- llama.cpp selbst gebaut und auf einen geprüften Commit festgelegt
- vier schaltbare Profilcontainer plus ein isolierter Experimentalcontainer;
- fünf schaltbare Profilcontainer plus ein isolierter Experimentalcontainer;
davon ist immer exakt ein Inferenzcontainer aktiv
- `/fast`, `/medium`, `/large` und `/ultra` über den Profile Router
- `/fast`, `/medium`, `/large`, `/ultra` und `/uncensored` über den Profile Router
- verbindliche Standardmatrix: Fast MIX 76,8K, Medium Pure 160K (Default),
Large Pure 192K und Ultra Pure 256K
Large Pure 192K, Ultra Pure 256K sowie Abliterated Q4_K_M 80K als
bewusst nicht standardmäßiges Uncensored-Spezialprofil
- `/ultra`: getestetes text-only 256K-Profil (IQ4_XS Pure, beide GPUs,
80:20); etwa 68 Token/s und erfolgreicher 220K-Prompt-Fülltest
- Open WebUI als einzige normale Oberfläche
@@ -107,7 +108,7 @@ Die Profilwerte wurden auf RTX 5080 und RTX 3060 vermessen und bilden die
verbindliche Standardmatrix. Neue Varianten ersetzen sie erst nach demselben
Vergleichstest und einer dokumentierten Entscheidung.
Der integrierte Vision-Projektor der Profile Fast, Medium und Large läuft
Der integrierte Vision-Projektor der Profile Fast, Medium, Large und Uncensored läuft
gezielt auf der RTX 3060. Das hält den knappen VRAM der RTX 5080 für Modell und
Kontext frei und beschleunigte den dokumentierten synthetischen Vision-Test
gegenüber CPU-Vision um etwa den Faktor 8,5 bei der Gesamtzeit.