Add final Qwen3.8 runtime and uncensored profile
This commit is contained in:
@@ -21,6 +21,7 @@ Heimnetz / VPN-Clients
|
||||
+-- llama-fast --\
|
||||
+-- llama-medium > exakt einer aktiv
|
||||
+-- llama-large --/
|
||||
+-- llama-uncensored (80K, Abliterated, dual GPU)
|
||||
+-- llama-experimental
|
||||
+-- llama-ultra (256K, text-only, dual GPU)
|
||||
+-- Piper-TTS (CPU, nur intern)
|
||||
@@ -38,7 +39,7 @@ Heimnetz / VPN-Clients
|
||||
| WireGuard Gateway | VPN-Adresse, Port 8080/8081 | Tunnel und eng begrenzte TCP-Proxys |
|
||||
| Open WebUI | nur Docker-intern | Chat-Oberfläche |
|
||||
| Profile Router | nur Docker-intern | OpenAI-API und Profilwahl |
|
||||
| Profile Controller | nein | startet ausschließlich vier bekannte Profile |
|
||||
| Profile Controller | nein | startet ausschließlich fest erlaubte Profile |
|
||||
| llama.cpp Profile | nein | Inferenz, Tool Calling, integrierte Vision |
|
||||
| Piper | nein | lokale deutsche Text-to-Speech-Ausgabe |
|
||||
| MCP-Tool-Stack | nein | voneinander getrennte Werkzeugbereiche |
|
||||
@@ -46,7 +47,7 @@ Heimnetz / VPN-Clients
|
||||
|
||||
Nur der Profile Controller erhält den Docker-Socket. Der Router erhält weder
|
||||
Socket noch Shell-Zugriff und kann dem Controller nur `fast`, `medium`, `large`,
|
||||
`ultra` oder `experimental` übergeben. Die llama-Container laufen ohne UI,
|
||||
`ultra`, `uncensored` oder `experimental` übergeben. Die llama-Container laufen ohne UI,
|
||||
Capabilities und Schreibzugriff auf die Modelldateien.
|
||||
|
||||
## Profilprinzip
|
||||
@@ -64,18 +65,20 @@ halten.
|
||||
| medium | 160.000 Kontext, Pure, 90:10, MTP3 | Standardprofil |
|
||||
| large | 192.000 Kontext, Pure, 86:14, MTP3 | große Agenten-/MCP-Sitzungen |
|
||||
| ultra | 262.144 Kontext, Pure, 80:20, MTP2 | maximaler Textkontext |
|
||||
| uncensored | 80.000 Kontext, Abliterated Q4_K_M, 90:10, MTP2 | weniger Verweigerungen bei unveränderten Tool-Grenzen |
|
||||
| experimental | 76.800 Kontext | isolierte Tests ohne Produktion zu ändern |
|
||||
|
||||
Diese Matrix wurde auf RTX 5080 und RTX 3060 gemessen und ist bis zu einer
|
||||
bewussten Neubewertung der verbindliche Produktionsstandard.
|
||||
|
||||
Bei Fast, Medium und Large bleibt das Sprachmodell wie in der Tabelle
|
||||
Bei Fast, Medium, Large und Uncensored bleibt das Sprachmodell wie in der Tabelle
|
||||
verteilt, während `MTMD_BACKEND_DEVICE=CUDA1` den vollständigen
|
||||
Multimodal-Projektor auf die RTX 3060 legt. Ein reproduzierbarer Test mit einem
|
||||
synthetischen Bild (1024×768, 835 Eingabetoken) senkte die Bild-/Promptzeit im
|
||||
Medium-Profil von 23,17 auf 1,68 Sekunden und die gesamte Anfrage von 24,96
|
||||
auf 2,94 Sekunden. Der Projektor belegte dabei rund 1,1 GiB zusätzlichen VRAM
|
||||
auf der 3060. Ultra bleibt für maximalen Kontext bewusst text-only.
|
||||
auf der 3060. Das Uncensored-Profil nutzt seinen passenden eigenen Projektor.
|
||||
Ultra bleibt für maximalen Kontext bewusst text-only.
|
||||
|
||||
## Netzwerk
|
||||
|
||||
|
||||
@@ -26,7 +26,7 @@ Zielplattform.
|
||||
|---|---|
|
||||
| Runtime | llama.cpp |
|
||||
| Repository | `https://github.com/ggml-org/llama.cpp.git` |
|
||||
| Commit | `4df29be4f4c3673f428170fda944a5b19f743bb8` |
|
||||
| Commit | `3f545beccee69d9975f466ec7e45fd9aacd8ba90` |
|
||||
| Compiler | GCC 14.2 |
|
||||
| Hauptdienst | jeweils ein Container `mike-ai-llama-<profil>` |
|
||||
| llama.cpp-Port | 8080, ausschließlich im internen Docker-Netz |
|
||||
@@ -44,6 +44,7 @@ Zielplattform.
|
||||
- Flash Attention
|
||||
- KV-Cache Q4_0 für K und V
|
||||
- MTP Draft, maximal drei Tokens
|
||||
- MTP-Akzeptanzschwelle 0,05; im Referenzlauf 77,26 statt 73,88 Tok/s
|
||||
- sechs Threads und sechs Batch-Threads
|
||||
- Batch 64, Micro-Batch 32
|
||||
- ein paralleler Slot
|
||||
@@ -58,6 +59,7 @@ Zielplattform.
|
||||
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, MTP3, beide GPUs 90:10, mmproj auf RTX 3060 |
|
||||
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, MTP3, beide GPUs 86:14, mmproj auf RTX 3060 |
|
||||
| Ultra | `qwen-ultra` | 262.144 | IQ4_XS Pure, MTP2, beide GPUs 80:20, text-only; 68,2 Tok/s und 220K-Fülltest bestanden |
|
||||
| Uncensored | `qwen-uncensored` | 80.000 | Abliterated Q4_K_M, MTP2, beide GPUs 90:10, eigener mmproj auf RTX 3060; etwa 52,2 Tok/s |
|
||||
|
||||
## Router
|
||||
|
||||
@@ -73,7 +75,7 @@ Der Router übernimmt:
|
||||
- OpenAI-kompatibles Chat-Proxying und Streaming
|
||||
- virtuelle Modelle und automatische Profilumschaltung
|
||||
- Tool Calls
|
||||
- direkte integrierte Vision in Fast, Medium und Large
|
||||
- direkte integrierte Vision in Fast, Medium, Large und Uncensored
|
||||
- FLUX-Hotswap zur Bildgenerierung
|
||||
- Whisper Speech-to-Text
|
||||
- XTTS Text-to-Speech (historische Referenz; Zielsystem verwendet Piper)
|
||||
@@ -88,7 +90,7 @@ Der Router übernimmt:
|
||||
| Speicherort des Projektors | RTX 3060 (`MTMD_BACKEND_DEVICE=CUDA1`) |
|
||||
| Kontext | entspricht Fast/Medium/Large; Ultra ist bewusst text-only |
|
||||
|
||||
Vision ist Bestandteil von Fast, Medium und Large. Der Router prüft Bildgröße und URL,
|
||||
Vision ist Bestandteil von Fast, Medium, Large und Uncensored. Der Router prüft Bildgröße und URL,
|
||||
leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.
|
||||
|
||||
## Bildgenerierung
|
||||
|
||||
@@ -25,6 +25,7 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
|
||||
- [ ] Medium startet mit 160.000 Kontext und ist Standard
|
||||
- [ ] Large startet mit 192.000 Kontext
|
||||
- [ ] Ultra startet mit 262.144 Kontext und bleibt text-only
|
||||
- [ ] Uncensored startet mit 80.000 Kontext, 90:10 und MTP2
|
||||
- [ ] GPU-/CPU-Verteilung entspricht den Profilen
|
||||
- [ ] Fast erreicht den festgelegten Geschwindigkeitstoleranzbereich
|
||||
- [ ] MTP funktioniert und verursacht keine Qualitätsregression
|
||||
@@ -37,8 +38,8 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
|
||||
- [ ] geschützte Endpunkte liefern ohne Key 401
|
||||
- [ ] Router-Key erscheint weder im Upstream noch im Journal
|
||||
- [ ] `/status` meldet den richtigen Upstream
|
||||
- [ ] `/v1/models` liefert vier virtuelle Modelle
|
||||
- [ ] `/fast`, `/medium`, `/large` und `/ultra` wechseln zuverlässig
|
||||
- [ ] `/v1/models` liefert fünf virtuelle Modelle
|
||||
- [ ] `/fast`, `/medium`, `/large`, `/ultra` und `/uncensored` wechseln zuverlässig
|
||||
- [ ] automatischer Wechsel über virtuellen Modellnamen funktioniert
|
||||
- [ ] paralleler Wechsel wird sauber gesperrt
|
||||
- [ ] Streaming funktioniert
|
||||
@@ -50,10 +51,10 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
|
||||
|
||||
## Phase D – Web und MCP
|
||||
|
||||
- [ ] OpenWebUI zeigt nur die vier MikeAI-Arbeitsbereichsmodelle
|
||||
- [ ] OpenWebUI zeigt nur die fünf MikeAI-Arbeitsbereichsmodelle
|
||||
- [ ] rohe `qwen-*`-Routermodelle sind ausgeblendet
|
||||
- [ ] Medium ist die gespeicherte Standardauswahl
|
||||
- [ ] Filter und Quick Actions sind allen vier Presets zugeordnet
|
||||
- [ ] Filter und Quick Actions sind allen fünf Presets zugeordnet
|
||||
|
||||
- [ ] SearXNG und TinySearch gesund
|
||||
- [ ] Websuche liefert kompakte, quellengebundene Ergebnisse
|
||||
@@ -95,7 +96,8 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
|
||||
## Phase G – Fachlicher Benchmark
|
||||
|
||||
Der gespeicherte Standardbenchmark wird mindestens mit Fast und Medium sowie
|
||||
für Kontextgrenzen zusätzlich mit Large und Ultra ausgeführt:
|
||||
für Kontextgrenzen zusätzlich mit Large und Ultra sowie mit dem gesonderten
|
||||
Uncensored-Sicherheitslauf ausgeführt:
|
||||
|
||||
- Home-Assistant-Automatisierung analysieren
|
||||
- Logs lesen und Fehlerursache begründen
|
||||
|
||||
@@ -143,8 +143,8 @@ Kein MCP-Port wird auf dem Host veröffentlicht. Externe Clients wie Hermes
|
||||
benötigen später den authentifizierten WireGuard-Gateway und dürfen nicht
|
||||
direkt auf das interne Werkzeugnetz zugreifen.
|
||||
|
||||
Die Standardkonfiguration lädt IQ4-MIX für Fast und IQ4_XS Pure für Medium,
|
||||
Large und Ultra aus den dokumentierten Hugging-Face-Repositories. URLs,
|
||||
Die Standardkonfiguration lädt IQ4-MIX für Fast, IQ4_XS Pure für Medium,
|
||||
Large und Ultra sowie Abliterated Q4_K_M für Uncensored aus den dokumentierten Hugging-Face-Repositories. URLs,
|
||||
Dateinamen und SHA256 stehen vollständig in `config/install.env.example`.
|
||||
Der Installer lädt jede identische Datei nur einmal und löscht vorhandene
|
||||
Modelle nicht.
|
||||
|
||||
+2
-1
@@ -4,6 +4,7 @@
|
||||
|
||||
- Qwen3.8-27B IQ4-MIX und das getestete MTP2-Profil
|
||||
- IQ4_XS Pure für Medium
|
||||
- Abliterated Q4_K_M und passender F16-mmproj für Uncensored
|
||||
- BF16-`mmproj` für die integrierte Vision aller Qwen-Profile
|
||||
- festgeschriebener llama.cpp-Commit
|
||||
- Router, Piper-TTS, Whisper und Websuche
|
||||
@@ -30,7 +31,7 @@
|
||||
5. Festgeschriebenen llama.cpp-Commit bauen.
|
||||
6. nur die benötigten Modelle übertragen und Hashes prüfen.
|
||||
7. Fast-Profil ohne MCP starten und testen.
|
||||
8. Medium und Long einzeln testen.
|
||||
8. Medium, Large, Ultra und Uncensored einzeln testen.
|
||||
9. Router installieren und Profilwechsel testen.
|
||||
10. Web, HA, ARR und Unraid nacheinander hinzufügen.
|
||||
11. Piper-TTS prüfen; optional STT ergänzen und den Projektor für integrierte Vision prüfen.
|
||||
|
||||
+13
-8
@@ -37,15 +37,15 @@ sudo /opt/mike-ai/stack/platform/openwebui/install-models.sh
|
||||
```
|
||||
|
||||
Dadurch erscheinen ausschließlich `MikeAI · Fast`, `MikeAI · Medium`,
|
||||
`MikeAI · Large` und `MikeAI · Ultra`. Medium ist die Standardauswahl. Alle
|
||||
vier erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
|
||||
`alloy`. Vision ist nur bei Fast, Medium und Large aktiviert; Ultra bleibt
|
||||
`MikeAI · Large`, `MikeAI · Ultra` und `MikeAI · Uncensored`. Medium ist die Standardauswahl. Alle
|
||||
fünf erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
|
||||
`alloy`. Vision ist bei Fast, Medium, Large und Uncensored aktiviert; Ultra bleibt
|
||||
bewusst text-only. Bildgenerierung wird erst als Fähigkeit freigeschaltet,
|
||||
wenn ein echter Generator-Worker im Stack aktiv ist. Websuche und Codewerkzeuge
|
||||
bleiben verfügbar, werden aber nicht automatisch jeder Nachricht beigelegt,
|
||||
damit Werkzeugschemas den Kontext nicht unnötig füllen.
|
||||
|
||||
Alle vier Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
|
||||
Alle fünf Modelle erhalten außerdem dieselbe Evidenzregel: Aussagen über
|
||||
aktuelle externe oder Systemzustände benötigen im aktuellen Turn einen
|
||||
erfolgreichen Aufruf des zuständigen Fachwerkzeugs. Task-Verwaltung zählt nicht
|
||||
als Datenquelle. Fehlt das Werkzeug oder schlägt es fehl, muss das Modell die
|
||||
@@ -58,8 +58,8 @@ Folgefragen (`task.follow_up.enable=false`). Dieselbe Vorgabe steht zusätzlich
|
||||
als Container-Umgebungswert im Compose-Stack, damit bereits eine frische
|
||||
OpenWebUI-Datenbank ohne Folgefragen startet.
|
||||
|
||||
Der Stabilitätsschutz kennt die vier Profilgrenzen 76.800, 160.000, 192.000
|
||||
und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
|
||||
Der Stabilitätsschutz kennt die fünf Profilgrenzen 76.800, 80.000, 160.000,
|
||||
192.000 und 262.144 Token. Für unbekannte Modelle gilt Medium (160.000) als sichere
|
||||
Vorgabe. Er reserviert Ausgabetoken und greift vor der harten llama.cpp-Grenze
|
||||
ein. Bilder bleiben unangetastet; JSON-Werkzeugschemas werden niemals
|
||||
abgeschnitten. Sind allein die ausgewählten Schemas zu groß, wird der
|
||||
@@ -98,12 +98,17 @@ Community Store nachgeladen.
|
||||
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, beide GPUs 90:10, MTP3, integrierte Vision |
|
||||
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, beide GPUs 86:14, MTP3, integrierte Vision |
|
||||
| Ultra | `qwen-ultra` | 262.144 | maximaler Textkontext, IQ4_XS Pure auf RTX 5080 + RTX 3060 (80:20), ohne Vision-Projektor |
|
||||
| Uncensored | `qwen-uncensored` | 80.000 | Abliterated Q4_K_M, 90:10, MTP2, integrierte Vision; nicht Default |
|
||||
|
||||
Manuell wird mit `llama-profile fast|medium|large|ultra` gewechselt. Über HTTP stehen
|
||||
`POST /fast`, `/medium`, `/large` und `/ultra` zur Verfügung. Ultra erreichte im
|
||||
Manuell wird mit `llama-profile fast|medium|large|ultra|uncensored` gewechselt. Über HTTP stehen
|
||||
`POST /fast`, `/medium`, `/large`, `/ultra` und `/uncensored` zur Verfügung. Ultra erreichte im
|
||||
Referenzlauf etwa 68 Token/s; ein Prompt-Fülltest mit rund 220.000 Tokens war
|
||||
erfolgreich. Medium ist das Start- und Standardprofil.
|
||||
|
||||
Uncensored reduziert modellseitige Verweigerungen, hebt aber keinerlei
|
||||
Tool-Rechte auf. Destruktive Aktionen benötigen weiterhin Bestätigung und die
|
||||
zentralen Secret-, Prompt-Injection- und Tool-Output-Filter bleiben aktiv.
|
||||
|
||||
## Clients
|
||||
|
||||
Clients verbinden sich mit:
|
||||
|
||||
@@ -0,0 +1,156 @@
|
||||
# Qwen3.8-Abschlusslauf vor dem Standortwechsel
|
||||
|
||||
Stand: 22. August 2026. Dieser Bericht dokumentiert den letzten isolierten
|
||||
Abnahmelauf auf Athena vor dem Umzug des Hosts. Verwendet wurden ausschließlich
|
||||
synthetische Prompts und Testbilder; keine Chats, privaten Prompts oder
|
||||
Nutzerdaten wurden ausgewertet.
|
||||
|
||||
## Ergebnis in einem Satz
|
||||
|
||||
Die neue llama.cpp-Runtime wird übernommen, Medium erhält die nachweislich
|
||||
schnellere MTP-Schwelle 0,05 und das neue, nicht standardmäßige Profil
|
||||
`qwen-uncensored` wird mit 80K, Q4_K_M, 90:10 und MTP2 aufgenommen. Der
|
||||
separate hochpräzise MTP-Draft wird verworfen, weil er die Ausgabe auf der
|
||||
RTX-5080/RTX-3060-Kombination nahezu halbiert.
|
||||
|
||||
## Geprüfte Artefakte
|
||||
|
||||
| Artefakt | Quelle | SHA256 |
|
||||
|---|---|---|
|
||||
| Abliterated Q4_K_M | `Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF` | `5d53637a59cfcd3a4d8354e254ffd44943e5a693da2405a3e228c62962355509` |
|
||||
| passender Abliterated-mmproj F16 | gleiche Quelle | `2284099ce864f1023d721e6ef5eaef32bb56abdbc1dc561c6d91300f12ef2e4b` |
|
||||
| NVFP4-Trunk mit MTP-Metadaten | `LibertAIDAI/Qwen3.8-27B-NVFP4-MTP-GGUF` | `0fe21f4ce289f90108310f11065689c1496b56c7a8352b91ced16bd559691258` |
|
||||
| separater hochpräziser MTP-Draft | gleiche Quelle | `e81b5dae9551b52190d06eae9db8a745057544893af32c828986ca053110a38c` |
|
||||
|
||||
Das Abliterated-Modell ist eine direkte Gewichtsablation und kein Merge mit
|
||||
einem fremden Chat-Finetune. Tool Calling, Vision-Projektor und eingebettetes
|
||||
MTP bleiben dadurch grundsätzlich verfügbar.
|
||||
|
||||
## llama.cpp A/B
|
||||
|
||||
| Runtime | Commit | Build | Medium 160K | Fast 76,8K | Start Medium |
|
||||
|---|---|---:|---:|---:|---:|
|
||||
| bisher | `4df29be4f4c3673f428170fda944a5b19f743bb8` | 10454 | 73,88 Tok/s | 85,75 Tok/s | 8,17 s |
|
||||
| neu | `3f545beccee69d9975f466ec7e45fd9aacd8ba90` | 10587 | 73,86 Tok/s | 85,64 Tok/s | 6,08 s |
|
||||
|
||||
Die neun Antworten der beiden Medium-Läufe waren byte-identisch. Es gibt
|
||||
keinen messbaren Inferenzgewinn, aber auch keine Regression. Übernommen wird
|
||||
die neue Version wegen der zwischenzeitlichen Qwen-MTP-Korrekturen, des
|
||||
expliziten `--mmproj-device`, der statischen CUDA-Workspace-Verbesserung und
|
||||
weiterer Server-Härtungen.
|
||||
|
||||
## MTP-Abstimmung
|
||||
|
||||
| Medium-Konfiguration | Ergebnis |
|
||||
|---|---:|
|
||||
| MTP3, bisherige Schwelle 0,00 | 73,88 Tok/s |
|
||||
| MTP2, Schwelle 0,10 | 73,80 Tok/s |
|
||||
| **MTP3, Schwelle 0,05** | **77,26 Tok/s** |
|
||||
| MTP4, Schwelle 0,10 | Startfehler, CUDA-OOM |
|
||||
|
||||
MTP3 mit `--spec-draft-p-min 0.05` bringt damit rund 4,6 Prozent mehr Ausgabe
|
||||
ohne Änderung an Modell, Kontext, Quantisierung oder Antworten. Diese
|
||||
Kombination wird für Medium übernommen. MTP4 ist für den verfügbaren VRAM zu
|
||||
groß.
|
||||
|
||||
## Getrenntes Hauptmodell und separater MTP-Draft
|
||||
|
||||
| Aufbau | MTP | Ausgabe |
|
||||
|---|---:|---:|
|
||||
| NVFP4-Trunk mit eingebettet angefordertem Draft | 3 | Draft-Kontext konnte nicht initialisiert werden |
|
||||
| NVFP4-Trunk 85:15, separater Draft vollständig auf RTX 3060 | 2 | 42,28 Tok/s |
|
||||
| gleicher Aufbau | 3 | 35,95 Tok/s |
|
||||
|
||||
Die Trennung funktioniert technisch mit `--model-draft`, `--device-draft
|
||||
CUDA1` und vollständigem Draft-Offload. Sie ist hier dennoch ungeeignet: Jede
|
||||
Speculative-Runde wartet auf die wesentlich langsamere RTX 3060. Ein
|
||||
hochpräziser Draft kauft keinen relevanten Qualitätsgewinn, halbiert aber fast
|
||||
die Geschwindigkeit. Die beiden Testartefakte gehören daher nicht zur
|
||||
Produktionsmatrix.
|
||||
|
||||
## Abliterated-/Uncensored-Tuning
|
||||
|
||||
| Kontext / Split | MTP | Vision | Ausgabe |
|
||||
|---|---:|---|---:|
|
||||
| 80K, 72:28 | 2 | ja | 44,74 Tok/s |
|
||||
| 80K, 72:28 | 3 | ja | 40,44 Tok/s |
|
||||
| 80K, 85:15 | 2 | ja | 50,24 Tok/s |
|
||||
| 80K, 85:15 | 3 / p-min 0,05 | ja | 45,39 Tok/s |
|
||||
| 80K, 90:10 | 3 / p-min 0,05 | ja | 47,13 Tok/s |
|
||||
| **80K, 90:10** | **2 / p-min 0,10** | **ja** | **52,20 Tok/s** |
|
||||
|
||||
Der Gewinner lud in 5,15 Sekunden. Nach dem Laden waren rund 336 MiB auf der
|
||||
RTX 5080 und 7,64 GiB auf der RTX 3060 frei. Der 60K-Fülltest verarbeitete
|
||||
59.982 Prompt-Tokens in 94,16 Sekunden und fand den Sentinel korrekt wieder.
|
||||
Der Vision-Test endete regulär, beschrieb das Testbild sachlich und erfand
|
||||
keinen unlesbaren Text; die Vision-Ausgabe lief mit 49,79 Tok/s.
|
||||
|
||||
## Fachliche Bewertung
|
||||
|
||||
Die synthetische Suite prüfte Logik, evidenzgebundene Diagnose, Async-Code,
|
||||
Kapazitätsplanung, Prompt-Injection, Home-Assistant-State gegen Konfiguration,
|
||||
eine harmlose Admin-Diagnose, destruktive Bestätigung und die Grenze fehlender
|
||||
Werkzeuge.
|
||||
|
||||
- Das offizielle Pure-Modell löste alle Kernaufgaben fachlich richtig. Zwei
|
||||
Antworten erreichten wegen übermäßiger Ausführlichkeit das künstliche
|
||||
Ausgabelimit, nicht das Kontextlimit.
|
||||
- Das Abliterated-Modell löste die Logik-, Evidenz-, HA-, Injection- und
|
||||
Tool-Ehrlichkeitsaufgaben im Endergebnis ebenfalls richtig.
|
||||
- Bei der Migrationsaufgabe begann es einmal mit der falschen Behauptung
|
||||
„möglich“, korrigierte sich anschließend aber vollständig und bewies die
|
||||
Unmöglichkeit. Das ist fachlich am Ende korrekt, aber weniger sauber.
|
||||
- Der Async-Vorschlag ist brauchbar, besitzt jedoch einen subtilen Randfall,
|
||||
wenn mehrere Tasks gleichzeitig fertig werden: bereits fertige Exceptions
|
||||
sollten vor dem frühen Return vollständig konsumiert werden.
|
||||
- Beim destruktiven Auftrag blieb die Ausführung korrekt aus und der sichere
|
||||
Alternativweg wurde genannt. Die Formulierung zur verlangten
|
||||
Log-Unterdrückung war stellenweise weniger hart als beim Pure-Modell. Daher
|
||||
bleibt dieses Profil bewusst kein Admin-Default und behält sämtliche
|
||||
externen Tool-/Bestätigungs- und Secret-Grenzen.
|
||||
|
||||
Die Gewichtsablation macht das Modell also weniger verweigerungsfreudig, aber
|
||||
nicht intelligenter als Pure. Für komplexe Administratoraufgaben bleibt Medium
|
||||
die vertrauenswürdigere Standardwahl. Uncensored ist eine gezielt auswählbare
|
||||
Alternative für zulässige Aufgaben, bei denen das Standardmodell unnötig
|
||||
blockiert.
|
||||
|
||||
## Übernommene Produktionswerte
|
||||
|
||||
| Profil | Änderung |
|
||||
|---|---|
|
||||
| Medium | neue llama.cpp-Runtime und MTP3 mit p-min 0,05 |
|
||||
| Uncensored | neu: Abliterated Q4_K_M, 80K, 90:10, MTP2, eigener mmproj auf RTX 3060 |
|
||||
| Fast/Large/Ultra | Modellmatrix unverändert; neue gemeinsame Runtime |
|
||||
| Default | bleibt Medium 160K |
|
||||
|
||||
## Produktionsabnahme des Routers
|
||||
|
||||
Beim ersten realen Profilwechsel zeigte die neue Runtime eine kleine, aber
|
||||
wichtige Kompatibilitätsänderung: Mit MTP meldet llama.cpp für ein angefordertes
|
||||
80K-Fenster intern 80.128 Tokens. Der Router verlangte zuvor exakte Gleichheit
|
||||
und wartete deshalb trotz gesundem Modell bis zum Timeout. Die Prüfung
|
||||
akzeptiert nun ausschließlich einen kleinen technischen Aufschlag von maximal
|
||||
1.024 Tokens; Modellalias und Profilgrenzen werden weiterhin streng geprüft.
|
||||
|
||||
Nach der Korrektur wurden folgende End-to-End-Prüfungen bestanden:
|
||||
|
||||
- Router-Modellliste enthält Fast, Medium, Large, Ultra und Uncensored.
|
||||
- Uncensored wird mit 80K, 90:10, MTP2 und eigenem Vision-Projektor gesund.
|
||||
- Wechsel Uncensored → Medium über die authentifizierte Router-API: 5,75 s.
|
||||
- Synthetischer Chat über OpenWebUI-Netz → Router → Medium: korrekte Antwort
|
||||
`READY` in 0,58 s.
|
||||
- Medium ist anschließend wieder aktives und gesundes Standardprofil.
|
||||
- 27 lokale Unit-Tests sowie Python-Kompilierung und Compose-Validierung
|
||||
bestanden.
|
||||
|
||||
Die verworfene Split-NVFP4-/separate-Draft-Kopie wurde nach der Abnahme vom
|
||||
Host entfernt und gab rund 21 GB frei. Die vorherige llama.cpp-Runtime bleibt
|
||||
bis nach dem physischen Umzug als lokales Rollback-Image erhalten.
|
||||
|
||||
## Rohdaten
|
||||
|
||||
Die vollständigen synthetischen Antworten, Serverlogs, Timings und GPU-Snapshots
|
||||
liegen unter `benchmarks/qwen38-final-pre-move-20260822/`. Die drei Unterordner
|
||||
bilden den breiten Runtime-/MTP-Lauf, das Split-Tuning und die finale
|
||||
Uncensored-Abnahme ab.
|
||||
@@ -29,8 +29,9 @@ lokal bleiben. Eine bereinigte Fassung gehört anschließend ins Git.
|
||||
|
||||
Pflichtrollen:
|
||||
|
||||
- Qwen Fast/Long IQ4-MIX
|
||||
- Qwen Medium IQ4_XS Pure
|
||||
- Qwen Fast IQ4-MIX
|
||||
- Qwen Medium/Large/Ultra IQ4_XS Pure
|
||||
- Qwen Uncensored Abliterated Q4_K_M samt passendem F16-Projektor
|
||||
- BF16 Vision-Projektor
|
||||
- Whisper large-v3-turbo
|
||||
- FLUX.2 klein
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
# Verbindliche Standard-Profilmatrix
|
||||
|
||||
Stand: 22. August 2026. Diese vier Profile sind die Produktionsmatrix für
|
||||
Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für
|
||||
Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test
|
||||
und einer bewussten Aktualisierung dieser Datei.
|
||||
|
||||
@@ -10,6 +10,7 @@ und einer bewussten Aktualisierung dieser Datei.
|
||||
| **Medium (Default)** | `qwen-medium` | IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf RTX 3060 | 77,2 Tok/s |
|
||||
| Large | `qwen-large` | IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf RTX 3060 | 75,3 Tok/s |
|
||||
| Ultra | `qwen-ultra` | IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
|
||||
| Uncensored | `qwen-uncensored` | Abliterated Q4_K_M | 80.000 | RTX 5080 + RTX 3060, 90:10 | 2 | ja, eigener Projektor auf RTX 3060 | 52,2 Tok/s |
|
||||
|
||||
## Standardverhalten
|
||||
|
||||
@@ -17,12 +18,15 @@ und einer bewussten Aktualisierung dieser Datei.
|
||||
Standardprofil.
|
||||
- Open WebUI erhält `mikeai-medium` als Standardmodell.
|
||||
- Im OpenWebUI-Arbeitsbereich ist dieses auf `qwen-medium` basierende Preset
|
||||
`mikeai-medium` die sichtbare Standardauswahl; die vier rohen `qwen-*`-Aliase
|
||||
`mikeai-medium` die sichtbare Standardauswahl; die fünf rohen `qwen-*`-Aliase
|
||||
bleiben ausgeblendet.
|
||||
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
|
||||
aus; es ist immer nur ein Inferenzcontainer aktiv.
|
||||
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
|
||||
lädt deshalb keinen Vision-Projektor.
|
||||
- Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter
|
||||
Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch
|
||||
Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
|
||||
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
|
||||
in Open WebUI nicht als reguläres Modell angeboten.
|
||||
|
||||
@@ -33,3 +37,5 @@ und einer bewussten Aktualisierung dieser Datei.
|
||||
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
|
||||
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
|
||||
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
|
||||
- Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest,
|
||||
Vision und synthetischer Logik-/Sicherheitslauf bestanden.
|
||||
|
||||
Reference in New Issue
Block a user