Files
AI-Profile-Router/benchmarks/athena-qwen38-reference-20260920/RESULTS.md
T

879 B

Gespeicherte Qwen-Messwerte

Größte vollständig getestete Textkontexte, jeweils ein Slot. Geschwindigkeiten bei unterschiedlichen Eingabelängen nicht direkt als Quantisierungsgewinn vergleichen.

Modell / GPUs Gesamtkontext Gemessene Eingabe Prefill tok/s Ausgabe tok/s
pure-single-61440-ub128 61440 60517 1401.4 60.8
mix-single-76800-ub64 76800 75874 1101.6 54.7
pure-dual-262144-80-20 262144 261218 682.3 19.0

Kontrollierte kurze Pure-Referenz bei 32.768 Kontext: Prefill 2074,2 tok/s (4.196 Eingabetokens), deutsche Ausgabe 85,8 tok/s, Code 122,1 tok/s; jeweils Mittelwert aus zwei Läufen.

Vollständige Einzelläufe und weitere Kontext-/Microbatch-Konfigurationen sind in manifest.json und cases/ gespeichert. Pure-Qualitätsfehler und die Grenzen der Stichprobe stehen in QUALITY_REVIEW.md.