Files
AI-Profile-Router/docs/STANDARD_PROFILE_MATRIX.md
T

2.3 KiB

Verbindliche Standard-Profilmatrix

Stand: 22. August 2026. Diese fünf Profile sind die Produktionsmatrix für Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test und einer bewussten Aktualisierung dieser Datei.

Profil Virtuelles Modell GGUF Kontext GPUs / Split MTP Vision gemessene kurze Ausgabe
Fast qwen-fast IQ4-MIX 76.800 RTX 5080 2 ja, Projektor auf RTX 3060 85,5 Tok/s
Medium (Default) qwen-medium IQ4_XS Pure 160.000 RTX 5080 + RTX 3060, 90:10 3 ja, Projektor auf RTX 3060 77,2 Tok/s
Large qwen-large IQ4_XS Pure 192.000 RTX 5080 + RTX 3060, 86:14 3 ja, Projektor auf RTX 3060 75,3 Tok/s
Ultra qwen-ultra IQ4_XS Pure 262.144 RTX 5080 + RTX 3060, 80:20 2 nein, text-only 68,2 Tok/s
Uncensored qwen-uncensored Abliterated Q4_K_M 80.000 RTX 5080 + RTX 3060, 90:10 2 ja, eigener Projektor auf RTX 3060 52,2 Tok/s

Standardverhalten

  • Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive Standardprofil.
  • Open WebUI erhält mikeai-medium als Standardmodell.
  • Im OpenWebUI-Arbeitsbereich ist dieses auf qwen-medium basierende Preset mikeai-medium die sichtbare Standardauswahl; die fünf rohen qwen-*-Aliase bleiben ausgeblendet.
  • Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel aus; es ist immer nur ein Inferenzcontainer aktiv.
  • Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und lädt deshalb keinen Vision-Projektor.
  • Uncensored ist ein bewusst gewähltes Spezialprofil mit reduzierter Verweigerungsneigung. Es ändert weder Router-Authentifizierung noch Tool-Rechte, Bestätigungsregeln oder Secret-Filter und ist nicht Default.
  • Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird in Open WebUI nicht als reguläres Modell angeboten.

Nachweise

  • Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
  • Medium 160K: Pure 90:10 mit MTP3, 77,22 Tok/s.
  • Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
  • Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.
  • Uncensored 80K: Abliterated Q4_K_M 90:10 mit MTP2, 52,2 Tok/s; 60K-Fülltest, Vision und synthetischer Logik-/Sicherheitslauf bestanden.