Preserve Athena Qwen baseline and document ByteShape comparison
This commit is contained in:
@@ -0,0 +1,13 @@
|
||||
# Gespeicherte Qwen-Messwerte
|
||||
|
||||
Größte vollständig getestete Textkontexte, jeweils ein Slot. Geschwindigkeiten bei unterschiedlichen Eingabelängen nicht direkt als Quantisierungsgewinn vergleichen.
|
||||
|
||||
| Modell / GPUs | Gesamtkontext | Gemessene Eingabe | Prefill tok/s | Ausgabe tok/s |
|
||||
|---|---:|---:|---:|---:|
|
||||
| pure-single-61440-ub128 | 61440 | 60517 | 1401.4 | 60.8 |
|
||||
| mix-single-76800-ub64 | 76800 | 75874 | 1101.6 | 54.7 |
|
||||
| pure-dual-262144-80-20 | 262144 | 261218 | 682.3 | 19.0 |
|
||||
|
||||
Kontrollierte kurze Pure-Referenz bei 32.768 Kontext: Prefill 2074,2 tok/s (4.196 Eingabetokens), deutsche Ausgabe 85,8 tok/s, Code 122,1 tok/s; jeweils Mittelwert aus zwei Läufen.
|
||||
|
||||
Vollständige Einzelläufe und weitere Kontext-/Microbatch-Konfigurationen sind in manifest.json und cases/ gespeichert. Pure-Qualitätsfehler und die Grenzen der Stichprobe stehen in QUALITY_REVIEW.md.
|
||||
Reference in New Issue
Block a user