Add final Qwen3.8 runtime and uncensored profile

This commit is contained in:
Mikei386
2026-08-23 00:10:53 +02:00
parent 1a9d94d22f
commit 2ef894160a
57 changed files with 10089 additions and 54 deletions
+13 -8
View File
@@ -37,15 +37,15 @@ sudo /opt/mike-ai/stack/platform/openwebui/install-models.sh
```
Dadurch erscheinen ausschließlich `MikeAI · Fast`, `MikeAI · Medium`,
`MikeAI · Large` und `MikeAI · Ultra`. Medium ist die Standardauswahl. Alle
vier erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
`alloy`. Vision ist nur bei Fast, Medium und Large aktiviert; Ultra bleibt
`MikeAI · Large`, `MikeAI · Ultra` und `MikeAI · Uncensored`. Medium ist die Standardauswahl. Alle
fünf erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
`alloy`. Vision ist bei Fast, Medium, Large und Uncensored aktiviert; Ultra bleibt
bewusst text-only. Bildgenerierung wird erst als Fähigkeit freigeschaltet,
wenn ein echter Generator-Worker im Stack aktiv ist. Websuche und Codewerkzeuge
bleiben verfügbar, werden aber nicht automatisch jeder Nachricht beigelegt,
damit Werkzeugschemas den Kontext nicht unnötig füllen.
Alle vier Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
Alle fünf Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
aktuelle externe oder Systemzustände benötigen im aktuellen Turn einen
erfolgreichen Aufruf des zuständigen Fachwerkzeugs. Task-Verwaltung zählt nicht
als Datenquelle. Fehlt das Werkzeug oder schlägt es fehl, muss das Modell die
@@ -58,8 +58,8 @@ Folgefragen (`task.follow_up.enable=false`). Dieselbe Vorgabe steht zusätzlich
als Container-Umgebungswert im Compose-Stack, damit bereits eine frische
OpenWebUI-Datenbank ohne Folgefragen startet.
Der Stabilitätsschutz kennt die vier Profilgrenzen 76.800, 160.000, 192.000
und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
Der Stabilitätsschutz kennt die fünf Profilgrenzen 76.800, 80.000, 160.000,
192.000 und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
Vorgabe. Er reserviert Ausgabetoken und greift vor der harten llama.cpp-Grenze
ein. Bilder bleiben unangetastet; JSON-Werkzeugschemas werden niemals
abgeschnitten. Sind allein die ausgewählten Schemas zu groß, wird der
@@ -98,12 +98,17 @@ Community Store nachgeladen.
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, beide GPUs 90:10, MTP3, integrierte Vision |
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, beide GPUs 86:14, MTP3, integrierte Vision |
| Ultra | `qwen-ultra` | 262.144 | maximaler Textkontext, IQ4_XS Pure auf RTX 5080 + RTX 3060 (80:20), ohne Vision-Projektor |
| Uncensored | `qwen-uncensored` | 80.000 | Abliterated Q4_K_M, 90:10, MTP2, integrierte Vision; nicht Default |
Manuell wird mit `llama-profile fast|medium|large|ultra` gewechselt. Über HTTP stehen
`POST /fast`, `/medium`, `/large` und `/ultra` zur Verfügung. Ultra erreichte im
Manuell wird mit `llama-profile fast|medium|large|ultra|uncensored` gewechselt. Über HTTP stehen
`POST /fast`, `/medium`, `/large`, `/ultra` und `/uncensored` zur Verfügung. Ultra erreichte im
Referenzlauf etwa 68 Token/s; ein Prompt-Fülltest mit rund 220.000 Tokens war
erfolgreich. Medium ist das Start- und Standardprofil.
Uncensored reduziert modellseitige Verweigerungen, hebt aber keinerlei
Tool-Rechte auf. Destruktive Aktionen benötigen weiterhin Bestätigung und die
zentralen Secret-, Prompt-Injection- und Tool-Output-Filter bleiben aktiv.
## Clients
Clients verbinden sich mit: