Files

28 lines
1.5 KiB
Markdown

# Automatische Einpassung von Sprachmodellen
Unter **Sprachmodelle / Chat → Auto-Test** wählst du ein heruntergeladenes
GGUF-Modell sowie Start- und End-Kontext. Nur die diskreten Kontextstufen
innerhalb dieses Bereichs werden geprüft. Der Test verwendet exklusiv die
Deck-Laufzeit; fremde GPU-Dienste werden weder gestoppt noch verändert.
Pro Stufe folgen zuerst 5080 allein und dann die Dual-GPU-Verteilungen 98:2,
95:5, 90:10, 85:15, 75:25 und 50:50 mit den Microbatches 128, 64 und 256.
CPU-Auslagerung wird nur versucht, wenn kein vollständiger GPU-Kandidat
funktioniert. Erst wenn die Grundverteilungen aller gewählten Stufen geprüft
sind, sucht Deck bei erfolgreichen Dual-GPU-Kandidaten in Ein-Layer-Schritten
nach mehr Layern auf der 5080.
Eine abgelehnte Speicherprognose wird als **Prognose, kein Modellstart**
gekennzeichnet. Fehler beim Modellstart oder bei der Messung beweisen für sich
allein keinen GPU-Out-of-Memory-Absturz. Ein erfolgreicher Kandidat muss einen
synthetischen Prompt bis nahe an das Kontextlimit plus 64 Ausgabetoken
verarbeiten. Die Oberfläche nennt die tatsächlich geprüften Eingabe-Tokens
und ihren Anteil am Kontext; 100 % sind wegen der Ausgabetoken und
Template-Reserve nicht möglich.
Der Lauf endet spätestens nach 300 Kandidaten oder zwei Stunden. Wenn dabei
eine Stufe nicht vollständig geprüft wurde, steht der Zustand auf
**unvollständig** statt abgeschlossen. Die vollständig geprüften Kontextstufen
werden angezeigt. Ein gespeichertes Ergebnis wird nicht automatisch am
API-Endpunkt freigegeben.