# Automatische Einpassung von Sprachmodellen Unter **Sprachmodelle / Chat → Auto-Test** wählst du ein heruntergeladenes GGUF-Modell sowie Start- und End-Kontext. Nur die diskreten Kontextstufen innerhalb dieses Bereichs werden geprüft. Der Test verwendet exklusiv die Deck-Laufzeit; fremde GPU-Dienste werden weder gestoppt noch verändert. Pro Stufe folgen zuerst 5080 allein und dann die Dual-GPU-Verteilungen 98:2, 95:5, 90:10, 85:15, 75:25 und 50:50 mit den Microbatches 128, 64 und 256. CPU-Auslagerung wird nur versucht, wenn kein vollständiger GPU-Kandidat funktioniert. Erst wenn die Grundverteilungen aller gewählten Stufen geprüft sind, sucht Deck bei erfolgreichen Dual-GPU-Kandidaten in Ein-Layer-Schritten nach mehr Layern auf der 5080. Eine abgelehnte Speicherprognose wird als **Prognose, kein Modellstart** gekennzeichnet. Fehler beim Modellstart oder bei der Messung beweisen für sich allein keinen GPU-Out-of-Memory-Absturz. Ein erfolgreicher Kandidat muss einen synthetischen Prompt bis nahe an das Kontextlimit plus 64 Ausgabetoken verarbeiten. Die Oberfläche nennt die tatsächlich geprüften Eingabe-Tokens und ihren Anteil am Kontext; 100 % sind wegen der Ausgabetoken und Template-Reserve nicht möglich. Der Lauf endet spätestens nach 300 Kandidaten oder zwei Stunden. Wenn dabei eine Stufe nicht vollständig geprüft wurde, steht der Zustand auf **unvollständig** statt abgeschlossen. Die vollständig geprüften Kontextstufen werden angezeigt. Ein gespeichertes Ergebnis wird nicht automatisch am API-Endpunkt freigegeben.