3.0 KiB
3.0 KiB
Verbindliche Standard-Profilmatrix
Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test und einer bewussten Aktualisierung dieser Datei.
| Profil | Virtuelles Modell | GGUF | Kontext | GPUs / Split | MTP | Vision | gemessene kurze Ausgabe |
|---|---|---|---|---|---|---|---|
| Fast | qwen-fast |
IQ4-MIX | 76.800 | RTX 5080 | 2 | ja, Projektor auf RTX 3060 | 85,5 Tok/s |
| Medium (Default) | qwen-medium |
IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf RTX 3060 | 77,2 Tok/s |
| Large | qwen-large |
IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf RTX 3060 | 75,3 Tok/s |
| Ultra | qwen-ultra |
IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
| Uncensored | qwen-uncensored |
Abliterated Q4_K_M | 80.000 | RTX 5080 + RTX 3060, 90:10 | 2 | ja, eigener Projektor auf RTX 3060 | 52,2 Tok/s |
Standardverhalten
- Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive Standardprofil.
- Open WebUI erhält
mikeai-mediumals Standardmodell. - Im OpenWebUI-Arbeitsbereich ist dieses auf
qwen-mediumbasierende Presetmikeai-mediumdie sichtbare Standardauswahl; die fünf rohenqwen-*-Aliase bleiben ausgeblendet. - Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel aus; es ist immer nur ein Inferenzcontainer aktiv.
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und lädt deshalb keinen Vision-Projektor.
- Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird in Open WebUI nicht als reguläres Modell angeboten.
Hermes-Kompressionsmodell
Das Hilfsmodell qwen-compression ist kein Chatprofil. Qwen3.5-2B Q4_K_M
läuft unabhängig mit 65.536 Token Kontext auf der RTX 3060 und ist nur über
WireGuard auf Port 8099 erreichbar. Hermes erzwingt dafür Non-Thinking.
- 30.245 Token, kalter Prompt: 4.519,7 Prefill-Tok/s.
- Ausgabe im 30K-Qualitätstest: 117,1 Tok/s; vier von fünf ungefilterten Ankern bewahrt.
- Echter Hermes-Hilfsmodellaufruf: 158 Token in 4,6 Sekunden; alle geforderten Pfade, Ports, Verbote und der Commit-Anker wurden bewahrt.
- Zusätzlicher Speicherbedarf auf der RTX 3060: rund 1,8 GiB; nach dem Laden blieben im gemessenen Produktionszustand rund 4,5 GiB frei.
Nachweise
- Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
- Medium 160K: Pure 90:10 mit MTP3, 77,22 Tok/s.
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
- Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest, Vision und synthetischer Logik-/Sicherheitslauf bestanden.