Files
AI-Profile-Router/docs/STANDARD_PROFILE_MATRIX.md
T

34 lines
1.7 KiB
Markdown

# Verbindliche Standard-Profilmatrix
Stand: 22. August 2026. Diese vier Profile sind die Produktionsmatrix für
Athena. Änderungen gelten erst nach einem vergleichbaren synthetischen Test
und einer bewussten Aktualisierung dieser Datei.
| Profil | Virtuelles Modell | GGUF | Kontext | GPUs / Split | MTP | Vision | gemessene kurze Ausgabe |
|---|---|---|---:|---|---:|---|---:|
| Fast | `qwen-fast` | IQ4-MIX | 76.800 | RTX 5080 | 2 | ja, Projektor auf CPU | 85,5 Tok/s |
| **Medium (Default)** | `qwen-medium` | IQ4_XS Pure | 160.000 | RTX 5080 + RTX 3060, 90:10 | 3 | ja, Projektor auf CPU | 77,2 Tok/s |
| Large | `qwen-large` | IQ4_XS Pure | 192.000 | RTX 5080 + RTX 3060, 86:14 | 3 | ja, Projektor auf CPU | 75,3 Tok/s |
| Ultra | `qwen-ultra` | IQ4_XS Pure | 262.144 | RTX 5080 + RTX 3060, 80:20 | 2 | nein, text-only | 68,2 Tok/s |
## Standardverhalten
- Medium ist nach Neuinstallation und bewusstem Plattformstart das aktive
Standardprofil.
- Open WebUI erhält `qwen-medium` als Standardmodell.
- Ein explizit gewähltes anderes Modell löst den zugehörigen Containerwechsel
aus; es ist immer nur ein Inferenzcontainer aktiv.
- Ultra reserviert den verfügbaren Speicher für nativen 256K-Textkontext und
lädt deshalb keinen Vision-Projektor.
- Das gesonderte Experimentalprofil gehört nicht zur Benutzer-Matrix und wird
in Open WebUI nicht als reguläres Modell angeboten.
## Nachweise
- Fast 76,8K: synthetischer Referenzlauf, 85,50 Tok/s.
- Medium 160K: Pure 90:10 mit MTP3, 77,22 Tok/s.
- Large 192K: Pure 86:14 mit MTP3, 75,28 Tok/s.
- Ultra 256K: Pure 80:20 mit MTP2, 68,19 Tok/s; 220.190 Tokens
erfolgreich verarbeitet und Sentinel korrekt wiedergefunden.