Files
Athena-Deck/AUTO_TEST.md
T

1.5 KiB

Automatische Einpassung von Sprachmodellen

Unter Sprachmodelle / Chat → Auto-Test wählst du ein heruntergeladenes GGUF-Modell sowie Start- und End-Kontext. Nur die diskreten Kontextstufen innerhalb dieses Bereichs werden geprüft. Der Test verwendet exklusiv die Deck-Laufzeit; fremde GPU-Dienste werden weder gestoppt noch verändert.

Pro Stufe folgen zuerst 5080 allein und dann die Dual-GPU-Verteilungen 98:2, 95:5, 90:10, 85:15, 75:25 und 50:50 mit den Microbatches 128, 64 und 256. CPU-Auslagerung wird nur versucht, wenn kein vollständiger GPU-Kandidat funktioniert. Erst wenn die Grundverteilungen aller gewählten Stufen geprüft sind, sucht Deck bei erfolgreichen Dual-GPU-Kandidaten in Ein-Layer-Schritten nach mehr Layern auf der 5080.

Eine abgelehnte Speicherprognose wird als Prognose, kein Modellstart gekennzeichnet. Fehler beim Modellstart oder bei der Messung beweisen für sich allein keinen GPU-Out-of-Memory-Absturz. Ein erfolgreicher Kandidat muss einen synthetischen Prompt bis nahe an das Kontextlimit plus 64 Ausgabetoken verarbeiten. Die Oberfläche nennt die tatsächlich geprüften Eingabe-Tokens und ihren Anteil am Kontext; 100 % sind wegen der Ausgabetoken und Template-Reserve nicht möglich.

Der Lauf endet spätestens nach 300 Kandidaten oder zwei Stunden. Wenn dabei eine Stufe nicht vollständig geprüft wurde, steht der Zustand auf unvollständig statt abgeschlossen. Die vollständig geprüften Kontextstufen werden angezeigt. Ein gespeichertes Ergebnis wird nicht automatisch am API-Endpunkt freigegeben.