Show native prefill and generation timing in chat tests

This commit is contained in:
Mikei386
2026-09-28 20:47:32 +02:00
parent 7ada7f6f20
commit ec62c859f7
4 changed files with 24 additions and 3 deletions
+2
View File
@@ -154,3 +154,5 @@ ist kein Nachweis für fehlerfreien Betrieb. Bestätigte Cgroup-OOM-Kills werden
als RAM-OOM gemeldet; ein GPU-OOM wird ohne eindeutigen Nachweis nicht behauptet.
Ein nicht eindeutig diagnostizierter Prozessabbruch nennt Speicher, Modell/Build
oder Zeitlimit als mögliche Ursachen. Bestehende Anwendungslogs werden nicht gelesen.
Der interne Chat-Test liefert `job.timings` (Prefill/Generierung: Token, Millisekunden und Token/s) und `job.usage` aus der finalen llama.cpp-Streamantwort. Fehlende Messwerte bleiben leer, insbesondere bei Abbruch. Prefill zählt berechnete Token, usage die gesamte Eingabe inklusive wiederverwendetem Kontext. Modellladen und Warteschlange sind nicht Teil der Token/s.