64 lines
3.6 KiB
Markdown
64 lines
3.6 KiB
Markdown
# Verbindliche Standard-Profilmatrix
|
|
|
|
Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für
|
|
Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test
|
|
und einer bewussten Aktualisierung dieser Datei.
|
|
|
|
| Profil | Virtuelles Modell | GGUF | Kontext | GPUs / Split | MTP | Vision | gemessene kurze Ausgabe |
|
|
|---|---|---|---:|---|---:|---|---:|
|
|
| Fast | `qwen-fast` | IQ4-MIX | 76.800 | RTX 5080 | 2 | ja, Projektor auf RTX 3060 | 85,5 Tok/s |
|
|
| **Medium (Default)** | `qwen-medium` | IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf RTX 3060 | 77,2 Tok/s |
|
|
| Large | `qwen-large` | IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf RTX 3060 | 75,3 Tok/s |
|
|
| Ultra | `qwen-ultra` | IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
|
|
| Uncensored | `qwen-uncensored` | Abliterated Q4_K_M | 80.000 | RTX 5080 + RTX 3060, 90:10 | 2 | ja, eigener Projektor auf RTX 3060 | 52,2 Tok/s |
|
|
|
|
## Standardverhalten
|
|
|
|
- Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive
|
|
Standardprofil.
|
|
- Open WebUI erhält `mikeai-medium` als Standardmodell.
|
|
- Im OpenWebUI-Arbeitsbereich ist dieses auf `qwen-medium` basierende Preset
|
|
`mikeai-medium` die sichtbare Standardauswahl; die fünf rohen `qwen-*`-Aliase
|
|
bleiben ausgeblendet.
|
|
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
|
|
aus; es ist immer nur ein Inferenzcontainer aktiv.
|
|
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
|
|
lädt deshalb keinen Vision-Projektor.
|
|
- Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter
|
|
Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch
|
|
Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
|
|
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
|
|
in Open WebUI nicht als reguläres Modell angeboten.
|
|
|
|
## Experimentelles Hermes-Kompressionsmodell
|
|
|
|
Der Alias `qwen-compression` ist kein Chatprofil. Qwen3.5-4B Q4_K_M kann
|
|
unabhängig mit 65.536 Token Kontext auf der RTX 3060 gestartet werden und ist
|
|
dann nur über WireGuard auf Port 8099 erreichbar. Non-Thinking und ein 12K-Notausgangslimit
|
|
verhindern bekannte Wiederholungsschleifen. Das Modell ist absichtlich **nicht
|
|
global in Hermes aktiviert**; produktive Kompression nutzt das gewählte
|
|
27B-Hauptprofil.
|
|
|
|
- 12 technische Fälle: 79,27 % exakte Anker im reinen Modellteil und 98,78 %
|
|
im vollständigen Hermes-Lean-Ergebnis; 10 von 12 formal bestanden.
|
|
- Echter 205K-Token-End-to-End-Lauf: Kompression auf 22,8K in 199 Sekunden,
|
|
aber ältere `BUILD_ID`- und kurze Git-HEAD-Zustände gingen verloren.
|
|
- Lange technische Einzeltests benötigten 120 bis 185 Sekunden; Ausgabe bei
|
|
großem Kontext etwa 50 Tok/s.
|
|
- Speicherbelegung der RTX 3060 im gemessenen Gesamtzustand: 9.450 MiB,
|
|
verbleibend rund 2.460 MiB.
|
|
- Sicherheitsentscheidung: als reproduzierbarer Testdienst behalten, aber
|
|
erst nach zuverlässig vollständiger technischer Zustandsbewahrung als
|
|
globalen Kompressor freigeben. Der Container bleibt außerhalb gezielter
|
|
Benchmarks gestoppt, damit die RTX 3060 für Medium/Large/Ultra frei ist.
|
|
|
|
## Nachweise
|
|
|
|
- Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
|
|
- Medium 160K: Pure 90:10 mit MTP3, 77,22 Tok/s.
|
|
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
|
|
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
|
|
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
|
|
- Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest,
|
|
Vision und synthetischer Logik-/Sicherheitslauf bestanden.
|