Provision OpenWebUI workspace model presets

This commit is contained in:
Mikei386
2026-08-22 11:37:30 +02:00
parent 41b9c17f0f
commit 95ed583a66
6 changed files with 267 additions and 12 deletions
+11 -4
View File
@@ -22,8 +22,9 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
- [ ] llama.cpp entspricht dem festgelegten Commit
- [ ] Modelldateien stimmen mit SHA256 überein
- [ ] Fast startet mit 76.800 Kontext
- [ ] Medium startet mit 94.208 Kontext
- [ ] Long startet mit 131.072 Kontext
- [ ] Medium startet mit 160.000 Kontext und ist Standard
- [ ] Large startet mit 192.000 Kontext
- [ ] Ultra startet mit 262.144 Kontext und bleibt text-only
- [ ] GPU-/CPU-Verteilung entspricht den Profilen
- [ ] Fast erreicht den festgelegten Geschwindigkeitstoleranzbereich
- [ ] MTP funktioniert und verursacht keine Qualitätsregression
@@ -36,7 +37,7 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
- [ ] geschützte Endpunkte liefern ohne Key 401
- [ ] Router-Key erscheint weder im Upstream noch im Journal
- [ ] `/status` meldet den richtigen Upstream
- [ ] `/v1/models` liefert drei virtuelle Modelle
- [ ] `/v1/models` liefert vier virtuelle Modelle
- [ ] `/fast`, `/medium`, `/large` und `/ultra` wechseln zuverlässig
- [ ] automatischer Wechsel über virtuellen Modellnamen funktioniert
- [ ] paralleler Wechsel wird sauber gesperrt
@@ -49,6 +50,11 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
## Phase D – Web und MCP
- [ ] OpenWebUI zeigt nur die vier MikeAI-Arbeitsbereichsmodelle
- [ ] rohe `qwen-*`-Routermodelle sind ausgeblendet
- [ ] Medium ist die gespeicherte Standardauswahl
- [ ] Filter und Quick Actions sind allen vier Presets zugeordnet
- [ ] SearXNG und TinySearch gesund
- [ ] Websuche liefert kompakte, quellengebundene Ergebnisse
- [ ] GitHub- und Hugging-Face-Routing geprüft
@@ -86,7 +92,8 @@ laufen, sondern alle fachlichen Funktionen geprüft wurden.
## Phase G – Fachlicher Benchmark
Der gespeicherte Standardbenchmark wird mindestens mit Fast und Long ausgeführt:
Der gespeicherte Standardbenchmark wird mindestens mit Fast und Medium sowie
für Kontextgrenzen zusätzlich mit Large und Ultra ausgeführt:
- Home-Assistant-Automatisierung analysieren
- Logs lesen und Fehlerursache begründen
+17 -5
View File
@@ -95,6 +95,18 @@ Zusätzlich prüfen: Uni-LAN sieht keine KI-Ports; Heimnetz erreicht beide;
gestopptes WireGuard lässt KI-Container nicht ins Internet; jeder Profilwechsel
startet exakt einen llama-Container; Text, Tool Call, Bild und Sprachausgabe funktionieren.
Nach dem ersten Anlegen des OpenWebUI-Administrators werden Filter, Quick
Actions und die vier Arbeitsbereichsmodelle reproduzierbar eingespielt:
```bash
sudo /opt/mike-ai/stack/platform/openwebui/install-filters.sh
sudo /opt/mike-ai/stack/platform/openwebui/install-models.sh
```
Danach sind nur die vier benannten MikeAI-Presets sichtbar; die rohen
Router-Aliase sind ausgeblendet und Medium ist die Standardauswahl. Beide
Skripte sichern die OpenWebUI-Datenbank vor jeder Änderung.
## Werkzeug-Container
Der Installer startet Websuche automatisch in einem privaten Docker-Netz.
@@ -122,11 +134,11 @@ Kein MCP-Port wird auf dem Host veröffentlicht. Externe Clients wie Hermes
benötigen später den authentifizierten WireGuard-Gateway und dürfen nicht
direkt auf das interne Werkzeugnetz zugreifen.
Die öffentliche Standardkonfiguration nutzt `UD-IQ4_XS`. Das bislang schnellste
Referenzprofil nutzt dagegen die lokal vorhandene `IQ4-MIX`-Datei. Für eine
bitgenaue Migration diese Datei anhand der in `CURRENT_REFERENCE.md`
dokumentierten SHA256 in das Modellverzeichnis kopieren und die drei
`*_MODEL_FILE`-Werte anpassen. Der Installer löscht vorhandene Modelle nicht.
Die Standardkonfiguration lädt IQ4-MIX für Fast und IQ4_XS Pure für Medium,
Large und Ultra aus den dokumentierten Hugging-Face-Repositories. URLs,
Dateinamen und SHA256 stehen vollständig in `config/install.env.example`.
Der Installer lädt jede identische Datei nur einmal und löscht vorhandene
Modelle nicht.
Open-WebUI-Daten liegen in einem Docker-Volume und müssen separat gesichert
werden. Geheimnisse und Chatdaten gehören nie in Git.
+16
View File
@@ -29,6 +29,22 @@ einer vorherigen Datenbanksicherung installiert beziehungsweise aktualisiert:
sudo /opt/mike-ai/stack/platform/openwebui/install-filters.sh
```
Die sichtbaren Arbeitsbereichsmodelle und die versteckten Router-Aliase werden
separat und ebenfalls mit vorheriger Datenbanksicherung installiert:
```bash
sudo /opt/mike-ai/stack/platform/openwebui/install-models.sh
```
Dadurch erscheinen ausschließlich `MikeAI · Fast`, `MikeAI · Medium`,
`MikeAI · Large` und `MikeAI · Ultra`. Medium ist die Standardauswahl. Alle
vier erhalten die geprüften Filter und Quick Actions sowie Piper-Stimme
`alloy`. Vision ist nur bei Fast, Medium und Large aktiviert; Ultra bleibt
bewusst text-only. Bildgenerierung wird erst als Fähigkeit freigeschaltet,
wenn ein echter Generator-Worker im Stack aktiv ist. Websuche und Codewerkzeuge
bleiben verfügbar, werden aber nicht automatisch jeder Nachricht beigelegt,
damit Werkzeugschemas den Kontext nicht unnötig füllen.
Bei mehreren Administratoren muss der gewünschte Eigentümer explizit über
`OPENWEBUI_FILTER_OWNER_ID` gesetzt werden. Das Skript liest oder verändert
keine Chats. Es deaktiviert zugleich global die automatisch erzeugten
+4 -2
View File
@@ -15,7 +15,10 @@ und einer bewussten Aktualisierung dieser Datei.
- Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive
Standardprofil.
- Open WebUI erhält `qwen-medium` als Standardmodell.
- Open WebUI erhält `mikeai-medium` als Standardmodell.
- Im OpenWebUI-Arbeitsbereich ist dieses auf `qwen-medium` basierende Preset
`mikeai-medium` die sichtbare Standardauswahl; die vier rohen `qwen-*`-Aliase
bleiben ausgeblendet.
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
aus; es ist immer nur ein Inferenzcontainer aktiv.
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
@@ -30,4 +33,3 @@ und einer bewussten Aktualisierung dieser Datei.
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.