28 lines
1.5 KiB
Markdown
28 lines
1.5 KiB
Markdown
# Automatische Einpassung von Sprachmodellen
|
|
|
|
Unter **Sprachmodelle / Chat → Auto-Test** wählst du ein heruntergeladenes
|
|
GGUF-Modell sowie Start- und End-Kontext. Nur die diskreten Kontextstufen
|
|
innerhalb dieses Bereichs werden geprüft. Der Test verwendet exklusiv die
|
|
Deck-Laufzeit; fremde GPU-Dienste werden weder gestoppt noch verändert.
|
|
|
|
Pro Stufe folgen zuerst 5080 allein und dann die Dual-GPU-Verteilungen 98:2,
|
|
95:5, 90:10, 85:15, 75:25 und 50:50 mit den Microbatches 128, 64 und 256.
|
|
CPU-Auslagerung wird nur versucht, wenn kein vollständiger GPU-Kandidat
|
|
funktioniert. Erst wenn die Grundverteilungen aller gewählten Stufen geprüft
|
|
sind, sucht Deck bei erfolgreichen Dual-GPU-Kandidaten in Ein-Layer-Schritten
|
|
nach mehr Layern auf der 5080.
|
|
|
|
Eine abgelehnte Speicherprognose wird als **Prognose, kein Modellstart**
|
|
gekennzeichnet. Fehler beim Modellstart oder bei der Messung beweisen für sich
|
|
allein keinen GPU-Out-of-Memory-Absturz. Ein erfolgreicher Kandidat muss einen
|
|
synthetischen Prompt bis nahe an das Kontextlimit plus 64 Ausgabetoken
|
|
verarbeiten. Die Oberfläche nennt die tatsächlich geprüften Eingabe-Tokens
|
|
und ihren Anteil am Kontext; 100 % sind wegen der Ausgabetoken und
|
|
Template-Reserve nicht möglich.
|
|
|
|
Der Lauf endet spätestens nach 300 Kandidaten oder zwei Stunden. Wenn dabei
|
|
eine Stufe nicht vollständig geprüft wurde, steht der Zustand auf
|
|
**unvollständig** statt abgeschlossen. Die vollständig geprüften Kontextstufen
|
|
werden angezeigt. Ein gespeichertes Ergebnis wird nicht automatisch am
|
|
API-Endpunkt freigegeben.
|