Add configurable MTP and shared-weight draft memory fitting

This commit is contained in:
Mikei386
2026-09-28 20:59:43 +02:00
parent ec62c859f7
commit 13ed059aaf
7 changed files with 87 additions and 12 deletions
+4
View File
@@ -157,3 +157,7 @@ Standardwerte (automatische Geräte, keine Aufteilung, Temperature 0.8, Top-p 0.
Top-k 40). Bestehende Dateien werden beim Lesen nicht umgeschrieben.
Sprachmodelle besitzen jetzt den Reiter **Testen**: interner Textchat mit Streaming, Profilauswahl und Speicherdiagnose. Öffentliche Profilfreigabe ist dafür nicht erforderlich. Details: [ENDPOINT.md](ENDPOINT.md#sprachmodelle--testen).
### MTP bei Sprachmodellprofilen
Im Profileditor kann MTP aktiviert werden, mit 1–8 Draft-Token und Mindestwahrscheinlichkeit 0–1. Medium-Referenz: 2 und 0,05; Draft-KV ist f16. Bestehende Profile bleiben standardmäßig ohne MTP. Das Modell muss eingebettete MTP-Gewichte enthalten. Der CUDA-Build benötigt den Deck-MTP-Fit-Adapter; neue GUI-Builds installieren ihn automatisch. Die Prognose zählt die gemeinsamen Gewichte einmal sowie Haupt- und MTP-Kontext und deren Compute-Puffer. Ein inkompatibles Modell oder ein alter Build wird nicht still ohne MTP gestartet. MTP garantiert keinen Geschwindigkeitsgewinn.