Add final Qwen3.8 runtime and uncensored profile
This commit is contained in:
+13
-8
@@ -37,15 +37,15 @@ sudo /opt/mike-ai/stack/platform/openwebui/install-models.sh
|
||||
```
|
||||
|
||||
Dadurch erscheinen ausschließlich `MikeAI · Fast`, `MikeAI · Medium`,
|
||||
`MikeAI · Large` und `MikeAI · Ultra`. Medium ist die Standardauswahl. Alle
|
||||
vier erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
|
||||
`alloy`. Vision ist nur bei Fast, Medium und Large aktiviert; Ultra bleibt
|
||||
`MikeAI · Large`, `MikeAI · Ultra` und `MikeAI · Uncensored`. Medium ist die Standardauswahl. Alle
|
||||
fünf erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
|
||||
`alloy`. Vision ist bei Fast, Medium, Large und Uncensored aktiviert; Ultra bleibt
|
||||
bewusst text-only. Bildgenerierung wird erst als Fähigkeit freigeschaltet,
|
||||
wenn ein echter Generator-Worker im Stack aktiv ist. Websuche und Codewerkzeuge
|
||||
bleiben verfügbar, werden aber nicht automatisch jeder Nachricht beigelegt,
|
||||
damit Werkzeugschemas den Kontext nicht unnötig füllen.
|
||||
|
||||
Alle vier Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
|
||||
Alle fünf Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
|
||||
aktuelle externe oder Systemzustände benötigen im aktuellen Turn einen
|
||||
erfolgreichen Aufruf des zuständigen Fachwerkzeugs. Task-Verwaltung zählt nicht
|
||||
als Datenquelle. Fehlt das Werkzeug oder schlägt es fehl, muss das Modell die
|
||||
@@ -58,8 +58,8 @@ Folgefragen (`task.follow_up.enable=false`). Dieselbe Vorgabe steht zusätzlich
|
||||
als Container-Umgebungswert im Compose-Stack, damit bereits eine frische
|
||||
OpenWebUI-Datenbank ohne Folgefragen startet.
|
||||
|
||||
Der Stabilitätsschutz kennt die vier Profilgrenzen 76.800, 160.000, 192.000
|
||||
und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
|
||||
Der Stabilitätsschutz kennt die fünf Profilgrenzen 76.800, 80.000, 160.000,
|
||||
192.000 und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
|
||||
Vorgabe. Er reserviert Ausgabetoken und greift vor der harten llama.cpp-Grenze
|
||||
ein. Bilder bleiben unangetastet; JSON-Werkzeugschemas werden niemals
|
||||
abgeschnitten. Sind allein die ausgewählten Schemas zu groß, wird der
|
||||
@@ -98,12 +98,17 @@ Community Store nachgeladen.
|
||||
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, beide GPUs 90:10, MTP3, integrierte Vision |
|
||||
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, beide GPUs 86:14, MTP3, integrierte Vision |
|
||||
| Ultra | `qwen-ultra` | 262.144 | maximaler Textkontext, IQ4_XS Pure auf RTX 5080 + RTX 3060 (80:20), ohne Vision-Projektor |
|
||||
| Uncensored | `qwen-uncensored` | 80.000 | Abliterated Q4_K_M, 90:10, MTP2, integrierte Vision; nicht Default |
|
||||
|
||||
Manuell wird mit `llama-profile fast|medium|large|ultra` gewechselt. Über HTTP stehen
|
||||
`POST /fast`, `/medium`, `/large` und `/ultra` zur Verfügung. Ultra erreichte im
|
||||
Manuell wird mit `llama-profile fast|medium|large|ultra|uncensored` gewechselt. Über HTTP stehen
|
||||
`POST /fast`, `/medium`, `/large`, `/ultra` und `/uncensored` zur Verfügung. Ultra erreichte im
|
||||
Referenzlauf etwa 68 Token/s; ein Prompt-Fülltest mit rund 220.000 Tokens war
|
||||
erfolgreich. Medium ist das Start- und Standardprofil.
|
||||
|
||||
Uncensored reduziert modellseitige Verweigerungen, hebt aber keinerlei
|
||||
Tool-Rechte auf. Destruktive Aktionen benötigen weiterhin Bestätigung und die
|
||||
zentralen Secret-, Prompt-Injection- und Tool-Output-Filter bleiben aktiv.
|
||||
|
||||
## Clients
|
||||
|
||||
Clients verbinden sich mit:
|
||||
|
||||
Reference in New Issue
Block a user