Files
AI-Profile-Router/benchmarks/athena-qwen38-reference-20260920/README.md
T

3.5 KiB

Feste Athena-Qwen-Referenz vom 20.09.2026

Bei weiteren Modelltests diese Ergebnisse wiederverwenden. Qwen nicht automatisch erneut benchmarken. Referenz-ID: athena-qwen38-reference-20260920-v1.

Die sieben abgeschlossenen Pure-/IQ4-MIX-Konfigurationen sind in manifest.json aufgelistet. Jede enthält Konfiguration, vollständige Originalantworten samt Reasoning, Server-Timings, Walltime, GPU-Samples und Serverlog. Die Dateien sind verlustfrei gzip-komprimiert. Gewichte selbst werden nicht ins Git aufgenommen; SHA256, Dateigröße und Athena-Pfad stehen in reference-environment.json.

Für den nächsten Kandidaten

  1. python3 benchmarks/athena-qwen38-reference-20260920/verify_reference.py prüft die archivierten Dateien lokal, ohne SSH/GPU/Modellaufruf.
  2. Passende Referenzkonfiguration auswählen: Pure für kontrollierte Quantisierungsvergleiche; MIX für das vorhandene Fast-Textprofil.
  3. Die gespeicherten Request-Payloads aus frozen-requests.json.gz verwenden. Nur Modellname/Endpoint an den Kandidaten anpassen; Sampling, Thinking und Ausgabelimits unverändert lassen oder Abweichungen ausdrücklich ausweisen.
  4. Neue Antworten getrennt speichern und anhand QUALITY_REVIEW.md sowie der vorhandenen Originalantworten beurteilen. Bewertet werden auch Begründungen und Fehlerpfade, nicht nur richtige Endurteile.
  5. Prefill, Generierung, Eingabelänge, Walltime, Kontext und GPU-Speicher dokumentieren. Fremde Tokenizer produzieren andere Tokenzahlen: dieselben Texte verwenden und zusätzlich Walltime vergleichen. Tok/s allein ist dann kein fairer modellübergreifender Geschwindigkeitsvergleich.

Die Requests wurden nach den Messungen aus dem damaligen Testcode und demselben Tokenizer rekonstruiert, ohne die Inferenztests zu wiederholen. Enthalten sind neun Qualitätsaufgaben, drei Follow-ups, zwei Decode-Aufgaben, ein Tool-Test und neun feste Langkontext-Eingaben; die beiden zusätzlichen langen Eingaben gehören zum ByteShape-Vergleich. Fallkonfigurationen bestimmen, welche Requests tatsächlich pro Referenzfall ausgeführt wurden. Ein Request im Paket ist allein noch kein Nachweis einer Messung. Der 50176-Fall enthält zweimal dieselbe 49152-Eingabe.

Gültigkeit und Grenzen

Die Referenz gilt für die dokumentierte Hardware, Laufzeit und Einstellungen. Änderungen an Treiber, Hardware, Last oder Messprotokoll beim nächsten Test als Vergleichseinschränkung nennen. Bei einem bewussten Laufzeitwechsel wird die Gesamtpipeline verglichen. Eine neue Qwen-Messreihe ist nur bei begründetem Rekalibrierungsbedarf erforderlich; dann neue Referenzversion anlegen, diese niemals überschreiben.

Text, ein Slot, q4_0-KV und kein Vision-Projektor: Die Werte sind kein Benchmark des parallelen Medium-Produktivbetriebs mit zwei Slots und Vision. TTS blieb auf der 3060 resident. Qualitätsstichprobe für Pure, keine eigene vollständige IQ4-MIX-Qualitätsprüfung, keine BF16-Referenz. Drei gefundene Fakten beweisen keine allgemeine Denkfähigkeit über das ganze Kontextfenster. Größter bestandener Kontext ist ein getesteter Betriebspunkt, keine garantierte Speichergrenze.

Ausführlicher Vergleich: ByteShape-Bericht. Kandidaten-Rohdaten und Testtreiber: ../../experiments/byteshape-20260920/. Die später ergänzte VRAM-Schutzprüfung ist im Testtreiber dokumentiert; sie war noch nicht Bestandteil der historischen Messungen. restore-verification.json belegt die abschließende Wiederherstellung und Kernelprüfung.