Add final Qwen3.8 runtime and uncensored profile

This commit is contained in:
Mikei386
2026-08-23 00:10:53 +02:00
parent 1a9d94d22f
commit 2ef894160a
57 changed files with 10089 additions and 54 deletions
+7 -4
View File
@@ -21,6 +21,7 @@ Heimnetz / VPN-Clients
+-- llama-fast --\
+-- llama-medium > exakt einer aktiv
+-- llama-large --/
+-- llama-uncensored (80K, Abliterated, dual GPU)
+-- llama-experimental
+-- llama-ultra (256K, text-only, dual GPU)
+-- Piper-TTS (CPU, nur intern)
@@ -38,7 +39,7 @@ Heimnetz / VPN-Clients
| WireGuard Gateway | VPN-Adresse, Port 8080/8081 | Tunnel und eng begrenzte TCP-Proxys |
| Open WebUI | nur Docker-intern | Chat-Oberfläche |
| Profile Router | nur Docker-intern | OpenAI-API und Profilwahl |
| Profile Controller | nein | startet ausschließlich vier bekannte Profile |
| Profile Controller | nein | startet ausschließlich fest erlaubte Profile |
| llama.cpp Profile | nein | Inferenz, Tool Calling, integrierte Vision |
| Piper | nein | lokale deutsche Text-to-Speech-Ausgabe |
| MCP-Tool-Stack | nein | voneinander getrennte Werkzeugbereiche |
@@ -46,7 +47,7 @@ Heimnetz / VPN-Clients
Nur der Profile Controller erhält den Docker-Socket. Der Router erhält weder
Socket noch Shell-Zugriff und kann dem Controller nur `fast`, `medium`, `large`,
`ultra` oder `experimental` übergeben. Die llama-Container laufen ohne UI,
`ultra`, `uncensored` oder `experimental` übergeben. Die llama-Container laufen ohne UI,
Capabilities und Schreibzugriff auf die Modelldateien.
## Profilprinzip
@@ -64,18 +65,20 @@ halten.
| medium | 160.000 Kontext, Pure, 90:10, MTP3 | Standardprofil |
| large | 192.000 Kontext, Pure, 86:14, MTP3 | große Agenten-/MCP-Sitzungen |
| ultra | 262.144 Kontext, Pure, 80:20, MTP2 | maximaler Textkontext |
| uncensored | 80.000 Kontext, Abliterated Q4_K_M, 90:10, MTP2 | weniger Verweigerungen bei unveränderten Tool-Grenzen |
| experimental | 76.800 Kontext | isolierte Tests ohne Produktion zu ändern |
Diese Matrix wurde auf RTX 5080 und RTX 3060 gemessen und ist bis zu einer
bewussten Neubewertung der verbindliche Produktionsstandard.
Bei Fast, Medium und Large bleibt das Sprachmodell wie in der Tabelle
Bei Fast, Medium, Large und Uncensored bleibt das Sprachmodell wie in der Tabelle
verteilt, während `MTMD_BACKEND_DEVICE=CUDA1` den vollständigen
Multimodal-Projektor auf die RTX 3060 legt. Ein reproduzierbarer Test mit einem
synthetischen Bild (1024×768, 835 Eingabetoken) senkte die Bild-/Promptzeit im
Medium-Profil von 23,17 auf 1,68 Sekunden und die gesamte Anfrage von 24,96
auf 2,94 Sekunden. Der Projektor belegte dabei rund 1,1 GiB zusätzlichen VRAM
auf der 3060. Ultra bleibt für maximalen Kontext bewusst text-only.
auf der 3060. Das Uncensored-Profil nutzt seinen passenden eigenen Projektor.
Ultra bleibt für maximalen Kontext bewusst text-only.
## Netzwerk
+5 -3
View File
@@ -26,7 +26,7 @@ Zielplattform.
|---|---|
| Runtime | llama.cpp |
| Repository | `https://github.com/ggml-org/llama.cpp.git` |
| Commit | `4df29be4f4c3673f428170fda944a5b19f743bb8` |
| Commit | `3f545beccee69d9975f466ec7e45fd9aacd8ba90` |
| Compiler | GCC 14.2 |
| Hauptdienst | jeweils ein Container `mike-ai-llama-<profil>` |
| llama.cpp-Port | 8080, ausschließlich im internen Docker-Netz |
@@ -44,6 +44,7 @@ Zielplattform.
- Flash Attention
- KV-Cache Q4_0 für K und V
- MTP Draft, maximal drei Tokens
- MTP-Akzeptanzschwelle 0,05; im Referenzlauf 77,26 statt 73,88 Tok/s
- sechs Threads und sechs Batch-Threads
- Batch 64, Micro-Batch 32
- ein paralleler Slot
@@ -58,6 +59,7 @@ Zielplattform.
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, MTP3, beide GPUs 90:10, mmproj auf RTX 3060 |
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, MTP3, beide GPUs 86:14, mmproj auf RTX 3060 |
| Ultra | `qwen-ultra` | 262.144 | IQ4_XS Pure, MTP2, beide GPUs 80:20, text-only; 68,2 Tok/s und 220K-Fülltest bestanden |
| Uncensored | `qwen-uncensored` | 80.000 | Abliterated Q4_K_M, MTP2, beide GPUs 90:10, eigener mmproj auf RTX 3060; etwa 52,2 Tok/s |
## Router
@@ -73,7 +75,7 @@ Der Router übernimmt:
- OpenAI-kompatibles Chat-Proxying und Streaming
- virtuelle Modelle und automatische Profilumschaltung
- Tool Calls
- direkte integrierte Vision in Fast, Medium und Large
- direkte integrierte Vision in Fast, Medium, Large und Uncensored
- FLUX-Hotswap zur Bildgenerierung
- Whisper Speech-to-Text
- XTTS Text-to-Speech (historische Referenz; Zielsystem verwendet Piper)
@@ -88,7 +90,7 @@ Der Router übernimmt:
| Speicherort des Projektors | RTX 3060 (`MTMD_BACKEND_DEVICE=CUDA1`) |
| Kontext | entspricht Fast/Medium/Large; Ultra ist bewusst text-only |
Vision ist Bestandteil von Fast, Medium und Large. Der Router prüft Bildgröße und URL,
Vision ist Bestandteil von Fast, Medium, Large und Uncensored. Der Router prüft Bildgröße und URL,
leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.
## Bildgenerierung
+7 -5
View File
@@ -25,6 +25,7 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
- [ ] Medium startet mit 160.000 Kontext und ist Standard
- [ ] Large startet mit 192.000 Kontext
- [ ] Ultra startet mit 262.144 Kontext und bleibt text-only
- [ ] Uncensored startet mit 80.000 Kontext, 90:10 und MTP2
- [ ] GPU-/CPU-Verteilung entspricht den Profilen
- [ ] Fast erreicht den festgelegten Geschwindigkeitstoleranzbereich
- [ ] MTP funktioniert und verursacht keine Qualitätsregression
@@ -37,8 +38,8 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
- [ ] geschützte Endpunkte liefern ohne Key 401
- [ ] Router-Key erscheint weder im Upstream noch im Journal
- [ ] `/status` meldet den richtigen Upstream
- [ ] `/v1/models` liefert vier virtuelle Modelle
- [ ] `/fast`, `/medium`, `/large` und `/ultra` wechseln zuverlässig
- [ ] `/v1/models` liefert fünf virtuelle Modelle
- [ ] `/fast`, `/medium`, `/large`, `/ultra` und `/uncensored` wechseln zuverlässig
- [ ] automatischer Wechsel über virtuellen Modellnamen funktioniert
- [ ] paralleler Wechsel wird sauber gesperrt
- [ ] Streaming funktioniert
@@ -50,10 +51,10 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
## Phase D – Web und MCP
- [ ] OpenWebUI zeigt nur die vier MikeAI-Arbeitsbereichsmodelle
- [ ] OpenWebUI zeigt nur die fünf MikeAI-Arbeitsbereichsmodelle
- [ ] rohe `qwen-*`-Routermodelle sind ausgeblendet
- [ ] Medium ist die gespeicherte Standardauswahl
- [ ] Filter und Quick Actions sind allen vier Presets zugeordnet
- [ ] Filter und Quick Actions sind allen fünf Presets zugeordnet
- [ ] SearXNG und TinySearch gesund
- [ ] Websuche liefert kompakte, quellengebundene Ergebnisse
@@ -95,7 +96,8 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
## Phase G – Fachlicher Benchmark
Der gespeicherte Standardbenchmark wird mindestens mit Fast und Medium sowie
für Kontextgrenzen zusätzlich mit Large und Ultra ausgeführt:
für Kontextgrenzen zusätzlich mit Large und Ultra sowie mit dem gesonderten
Uncensored-Sicherheitslauf ausgeführt:
- Home-Assistant-Automatisierung analysieren
- Logs lesen und Fehlerursache begründen
+2 -2
View File
@@ -143,8 +143,8 @@ Kein MCP-Port wird auf dem Host veröffentlicht. Externe Clients wie Hermes
benötigen später den authentifizierten WireGuard-Gateway und dürfen nicht
direkt auf das interne Werkzeugnetz zugreifen.
Die Standardkonfiguration lädt IQ4-MIX für Fast und IQ4_XS Pure für Medium,
Large und Ultra aus den dokumentierten Hugging-Face-Repositories. URLs,
Die Standardkonfiguration lädt IQ4-MIX für Fast, IQ4_XS Pure für Medium,
Large und Ultra sowie Abliterated Q4_K_M für Uncensored aus den dokumentierten Hugging-Face-Repositories. URLs,
Dateinamen und SHA256 stehen vollständig in `config/install.env.example`.
Der Installer lädt jede identische Datei nur einmal und löscht vorhandene
Modelle nicht.
+2 -1
View File
@@ -4,6 +4,7 @@
- Qwen3.8-27B IQ4-MIX und das getestete MTP2-Profil
- IQ4_XS Pure für Medium
- Abliterated Q4_K_M und passender F16-mmproj für Uncensored
- BF16-`mmproj` für die integrierte Vision aller Qwen-Profile
- festgeschriebener llama.cpp-Commit
- Router, Piper-TTS, Whisper und Websuche
@@ -30,7 +31,7 @@
5. Festgeschriebenen llama.cpp-Commit bauen.
6. nur die benötigten Modelle übertragen und Hashes prüfen.
7. Fast-Profil ohne MCP starten und testen.
8. Medium und Long einzeln testen.
8. Medium, Large, Ultra und Uncensored einzeln testen.
9. Router installieren und Profilwechsel testen.
10. Web, HA, ARR und Unraid nacheinander hinzufügen.
11. Piper-TTS prüfen; optional STT ergänzen und den Projektor für integrierte Vision prüfen.
+13 -8
View File
@@ -37,15 +37,15 @@ sudo /opt/mike-ai/stack/platform/openwebui/install-models.sh
```
Dadurch erscheinen ausschließlich `MikeAI · Fast`, `MikeAI · Medium`,
`MikeAI · Large` und `MikeAI · Ultra`. Medium ist die Standardauswahl. Alle
vier erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
`alloy`. Vision ist nur bei Fast, Medium und Large aktiviert; Ultra bleibt
`MikeAI · Large`, `MikeAI · Ultra` und `MikeAI · Uncensored`. Medium ist die Standardauswahl. Alle
fünf erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
`alloy`. Vision ist bei Fast, Medium, Large und Uncensored aktiviert; Ultra bleibt
bewusst text-only. Bildgenerierung wird erst als Fähigkeit freigeschaltet,
wenn ein echter Generator-Worker im Stack aktiv ist. Websuche und Codewerkzeuge
bleiben verfügbar, werden aber nicht automatisch jeder Nachricht beigelegt,
damit Werkzeugschemas den Kontext nicht unnötig füllen.
Alle vier Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
Alle fünf Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
aktuelle externe oder Systemzustände benötigen im aktuellen Turn einen
erfolgreichen Aufruf des zuständigen Fachwerkzeugs. Task-Verwaltung zählt nicht
als Datenquelle. Fehlt das Werkzeug oder schlägt es fehl, muss das Modell die
@@ -58,8 +58,8 @@ Folgefragen (`task.follow_up.enable=false`). Dieselbe Vorgabe steht zusätzlich
als Container-Umgebungswert im Compose-Stack, damit bereits eine frische
OpenWebUI-Datenbank ohne Folgefragen startet.
Der Stabilitätsschutz kennt die vier Profilgrenzen 76.800, 160.000, 192.000
und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
Der Stabilitätsschutz kennt die fünf Profilgrenzen 76.800, 80.000, 160.000,
192.000 und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
Vorgabe. Er reserviert Ausgabetoken und greift vor der harten llama.cpp-Grenze
ein. Bilder bleiben unangetastet; JSON-Werkzeugschemas werden niemals
abgeschnitten. Sind allein die ausgewählten Schemas zu groß, wird der
@@ -98,12 +98,17 @@ Community Store nachgeladen.
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, beide GPUs 90:10, MTP3, integrierte Vision |
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, beide GPUs 86:14, MTP3, integrierte Vision |
| Ultra | `qwen-ultra` | 262.144 | maximaler Textkontext, IQ4_XS Pure auf RTX 5080 + RTX 3060 (80:20), ohne Vision-Projektor |
| Uncensored | `qwen-uncensored` | 80.000 | Abliterated Q4_K_M, 90:10, MTP2, integrierte Vision; nicht Default |
Manuell wird mit `llama-profile fast|medium|large|ultra` gewechselt. Über HTTP stehen
`POST /fast`, `/medium`, `/large` und `/ultra` zur Verfügung. Ultra erreichte im
Manuell wird mit `llama-profile fast|medium|large|ultra|uncensored` gewechselt. Über HTTP stehen
`POST /fast`, `/medium`, `/large`, `/ultra` und `/uncensored` zur Verfügung. Ultra erreichte im
Referenzlauf etwa 68 Token/s; ein Prompt-Fülltest mit rund 220.000 Tokens war
erfolgreich. Medium ist das Start- und Standardprofil.
Uncensored reduziert modellseitige Verweigerungen, hebt aber keinerlei
Tool-Rechte auf. Destruktive Aktionen benötigen weiterhin Bestätigung und die
zentralen Secret-, Prompt-Injection- und Tool-Output-Filter bleiben aktiv.
## Clients
Clients verbinden sich mit:
@@ -0,0 +1,156 @@
# Qwen3.8-Abschlusslauf vor dem Standortwechsel
Stand: 22. August 2026. Dieser Bericht dokumentiert den letzten isolierten
Abnahmelauf auf Athena vor dem Umzug des Hosts. Verwendet wurden ausschließlich
synthetische Prompts und Testbilder; keine Chats, privaten Prompts oder
Nutzerdaten wurden ausgewertet.
## Ergebnis in einem Satz
Die neue llama.cpp-Runtime wird übernommen, Medium erhält die nachweislich
schnellere MTP-Schwelle 0,05 und das neue, nicht standardmäßige Profil
`qwen-uncensored` wird mit 80K, Q4_K_M, 90:10 und MTP2 aufgenommen. Der
separate hochpräzise MTP-Draft wird verworfen, weil er die Ausgabe auf der
RTX-5080/RTX-3060-Kombination nahezu halbiert.
## Geprüfte Artefakte
| Artefakt | Quelle | SHA256 |
|---|---|---|
| Abliterated Q4_K_M | `Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF` | `5d53637a59cfcd3a4d8354e254ffd44943e5a693da2405a3e228c62962355509` |
| passender Abliterated-mmproj F16 | gleiche Quelle | `2284099ce864f1023d721e6ef5eaef32bb56abdbc1dc561c6d91300f12ef2e4b` |
| NVFP4-Trunk mit MTP-Metadaten | `LibertAIDAI/Qwen3.8-27B-NVFP4-MTP-GGUF` | `0fe21f4ce289f90108310f11065689c1496b56c7a8352b91ced16bd559691258` |
| separater hochpräziser MTP-Draft | gleiche Quelle | `e81b5dae9551b52190d06eae9db8a745057544893af32c828986ca053110a38c` |
Das Abliterated-Modell ist eine direkte Gewichtsablation und kein Merge mit
einem fremden Chat-Finetune. Tool Calling, Vision-Projektor und eingebettetes
MTP bleiben dadurch grundsätzlich verfügbar.
## llama.cpp A/B
| Runtime | Commit | Build | Medium 160K | Fast 76,8K | Start Medium |
|---|---|---:|---:|---:|---:|
| bisher | `4df29be4f4c3673f428170fda944a5b19f743bb8` | 10454 | 73,88 Tok/s | 85,75 Tok/s | 8,17 s |
| neu | `3f545beccee69d9975f466ec7e45fd9aacd8ba90` | 10587 | 73,86 Tok/s | 85,64 Tok/s | 6,08 s |
Die neun Antworten der beiden Medium-Läufe waren byte-identisch. Es gibt
keinen messbaren Inferenzgewinn, aber auch keine Regression. Übernommen wird
die neue Version wegen der zwischenzeitlichen Qwen-MTP-Korrekturen, des
expliziten `--mmproj-device`, der statischen CUDA-Workspace-Verbesserung und
weiterer Server-Härtungen.
## MTP-Abstimmung
| Medium-Konfiguration | Ergebnis |
|---|---:|
| MTP3, bisherige Schwelle 0,00 | 73,88 Tok/s |
| MTP2, Schwelle 0,10 | 73,80 Tok/s |
| **MTP3, Schwelle 0,05** | **77,26 Tok/s** |
| MTP4, Schwelle 0,10 | Startfehler, CUDA-OOM |
MTP3 mit `--spec-draft-p-min 0.05` bringt damit rund 4,6 Prozent mehr Ausgabe
ohne Änderung an Modell, Kontext, Quantisierung oder Antworten. Diese
Kombination wird für Medium übernommen. MTP4 ist für den verfügbaren VRAM zu
groß.
## Getrenntes Hauptmodell und separater MTP-Draft
| Aufbau | MTP | Ausgabe |
|---|---:|---:|
| NVFP4-Trunk mit eingebettet angefordertem Draft | 3 | Draft-Kontext konnte nicht initialisiert werden |
| NVFP4-Trunk 85:15, separater Draft vollständig auf RTX 3060 | 2 | 42,28 Tok/s |
| gleicher Aufbau | 3 | 35,95 Tok/s |
Die Trennung funktioniert technisch mit `--model-draft`, `--device-draft
CUDA1` und vollständigem Draft-Offload. Sie ist hier dennoch ungeeignet: Jede
Speculative-Runde wartet auf die wesentlich langsamere RTX 3060. Ein
hochpräziser Draft kauft keinen relevanten Qualitätsgewinn, halbiert aber fast
die Geschwindigkeit. Die beiden Testartefakte gehören daher nicht zur
Produktionsmatrix.
## Abliterated-/Uncensored-Tuning
| Kontext / Split | MTP | Vision | Ausgabe |
|---|---:|---|---:|
| 80K, 72:28 | 2 | ja | 44,74 Tok/s |
| 80K, 72:28 | 3 | ja | 40,44 Tok/s |
| 80K, 85:15 | 2 | ja | 50,24 Tok/s |
| 80K, 85:15 | 3 / p-min 0,05 | ja | 45,39 Tok/s |
| 80K, 90:10 | 3 / p-min 0,05 | ja | 47,13 Tok/s |
| **80K, 90:10** | **2 / p-min 0,10** | **ja** | **52,20 Tok/s** |
Der Gewinner lud in 5,15 Sekunden. Nach dem Laden waren rund 336 MiB auf der
RTX 5080 und 7,64 GiB auf der RTX 3060 frei. Der 60K-Fülltest verarbeitete
59.982 Prompt-Tokens in 94,16 Sekunden und fand den Sentinel korrekt wieder.
Der Vision-Test endete regulär, beschrieb das Testbild sachlich und erfand
keinen unlesbaren Text; die Vision-Ausgabe lief mit 49,79 Tok/s.
## Fachliche Bewertung
Die synthetische Suite prüfte Logik, evidenzgebundene Diagnose, Async-Code,
Kapazitätsplanung, Prompt-Injection, Home-Assistant-State gegen Konfiguration,
eine harmlose Admin-Diagnose, destruktive Bestätigung und die Grenze fehlender
Werkzeuge.
- Das offizielle Pure-Modell löste alle Kernaufgaben fachlich richtig. Zwei
Antworten erreichten wegen übermäßiger Ausführlichkeit das künstliche
Ausgabelimit, nicht das Kontextlimit.
- Das Abliterated-Modell löste die Logik-, Evidenz-, HA-, Injection- und
Tool-Ehrlichkeitsaufgaben im Endergebnis ebenfalls richtig.
- Bei der Migrationsaufgabe begann es einmal mit der falschen Behauptung
„möglich“, korrigierte sich anschließend aber vollständig und bewies die
Unmöglichkeit. Das ist fachlich am Ende korrekt, aber weniger sauber.
- Der Async-Vorschlag ist brauchbar, besitzt jedoch einen subtilen Randfall,
wenn mehrere Tasks gleichzeitig fertig werden: bereits fertige Exceptions
sollten vor dem frühen Return vollständig konsumiert werden.
- Beim destruktiven Auftrag blieb die Ausführung korrekt aus und der sichere
Alternativweg wurde genannt. Die Formulierung zur verlangten
Log-Unterdrückung war stellenweise weniger hart als beim Pure-Modell. Daher
bleibt dieses Profil bewusst kein Admin-Default und behält sämtliche
externen Tool-/Bestätigungs- und Secret-Grenzen.
Die Gewichtsablation macht das Modell also weniger verweigerungsfreudig, aber
nicht intelligenter als Pure. Für komplexe Administratoraufgaben bleibt Medium
die vertrauenswürdigere Standardwahl. Uncensored ist eine gezielt auswählbare
Alternative für zulässige Aufgaben, bei denen das Standardmodell unnötig
blockiert.
## Übernommene Produktionswerte
| Profil | Änderung |
|---|---|
| Medium | neue llama.cpp-Runtime und MTP3 mit p-min 0,05 |
| Uncensored | neu: Abliterated Q4_K_M, 80K, 90:10, MTP2, eigener mmproj auf RTX 3060 |
| Fast/Large/Ultra | Modellmatrix unverändert; neue gemeinsame Runtime |
| Default | bleibt Medium 160K |
## Produktionsabnahme des Routers
Beim ersten realen Profilwechsel zeigte die neue Runtime eine kleine, aber
wichtige Kompatibilitätsänderung: Mit MTP meldet llama.cpp für ein angefordertes
80K-Fenster intern 80.128 Tokens. Der Router verlangte zuvor exakte Gleichheit
und wartete deshalb trotz gesundem Modell bis zum Timeout. Die Prüfung
akzeptiert nun ausschließlich einen kleinen technischen Aufschlag von maximal
1.024 Tokens; Modellalias und Profilgrenzen werden weiterhin streng geprüft.
Nach der Korrektur wurden folgende End-to-End-Prüfungen bestanden:
- Router-Modellliste enthält Fast, Medium, Large, Ultra und Uncensored.
- Uncensored wird mit 80K, 90:10, MTP2 und eigenem Vision-Projektor gesund.
- Wechsel Uncensored → Medium über die authentifizierte Router-API: 5,75 s.
- Synthetischer Chat über OpenWebUI-Netz → Router → Medium: korrekte Antwort
`READY` in 0,58 s.
- Medium ist anschließend wieder aktives und gesundes Standardprofil.
- 27 lokale Unit-Tests sowie Python-Kompilierung und Compose-Validierung
bestanden.
Die verworfene Split-NVFP4-/separate-Draft-Kopie wurde nach der Abnahme vom
Host entfernt und gab rund 21 GB frei. Die vorherige llama.cpp-Runtime bleibt
bis nach dem physischen Umzug als lokales Rollback-Image erhalten.
## Rohdaten
Die vollständigen synthetischen Antworten, Serverlogs, Timings und GPU-Snapshots
liegen unter `benchmarks/qwen38-final-pre-move-20260822/`. Die drei Unterordner
bilden den breiten Runtime-/MTP-Lauf, das Split-Tuning und die finale
Uncensored-Abnahme ab.
+3 -2
View File
@@ -29,8 +29,9 @@ lokal bleiben. Eine bereinigte Fassung gehört anschließend ins Git.
Pflichtrollen:
- Qwen Fast/Long IQ4-MIX
- Qwen Medium IQ4_XS Pure
- Qwen Fast IQ4-MIX
- Qwen Medium/Large/Ultra IQ4_XS Pure
- Qwen Uncensored Abliterated Q4_K_M samt passendem F16-Projektor
- BF16 Vision-Projektor
- Whisper large-v3-turbo
- FLUX.2 klein
+8 -2
View File
@@ -1,6 +1,6 @@
# Verbindliche Standard-Profilmatrix
Stand: 22. August 2026. Diese vier Profile sind die Produktionsmatrix für
Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für
Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test
und einer bewussten Aktualisierung dieser Datei.
@@ -10,6 +10,7 @@ und einer bewussten Aktualisierung dieser Datei.
| **Medium (Default)** | `qwen-medium` | IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf RTX 3060 | 77,2 Tok/s |
| Large | `qwen-large` | IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf RTX 3060 | 75,3 Tok/s |
| Ultra | `qwen-ultra` | IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
| Uncensored | `qwen-uncensored` | Abliterated Q4_K_M | 80.000 | RTX 5080 + RTX 3060, 90:10 | 2 | ja, eigener Projektor auf RTX 3060 | 52,2 Tok/s |
## Standardverhalten
@@ -17,12 +18,15 @@ und einer bewussten Aktualisierung dieser Datei.
Standardprofil.
- Open WebUI erhält `mikeai-medium` als Standardmodell.
- Im OpenWebUI-Arbeitsbereich ist dieses auf `qwen-medium` basierende Preset
`mikeai-medium` die sichtbare Standardauswahl; die vier rohen `qwen-*`-Aliase
`mikeai-medium` die sichtbare Standardauswahl; die fünf rohen `qwen-*`-Aliase
bleiben ausgeblendet.
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
aus; es ist immer nur ein Inferenzcontainer aktiv.
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
lädt deshalb keinen Vision-Projektor.
- Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter
Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch
Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
in Open WebUI nicht als reguläres Modell angeboten.
@@ -33,3 +37,5 @@ und einer bewussten Aktualisierung dieser Datei.
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
- Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest,
Vision und synthetischer Logik-/Sicherheitslauf bestanden.