Add GPU distribution and sampling controls to chat profiles

This commit is contained in:
Mikei386 committed 2026-09-28 19:51:49 +02:00
1 parent e2b521fcaa
commit 8d03a9a979
4 files changed
+68 -9

No files matched your search

+23
View File
@@ -132,3 +132,26 @@ Validierung: 63 Tests; reale isolierte Generierungen 512 × 512 / 2 Schritte und
1024 × 1024 / 25 Schritte. Letztere dauerte ca. 99 Sekunden, PNG visuell geprüft,
GPU danach wieder frei. Nutzerprofile unverändert. Die einfache Profil-/Prompt-/
Ergebnisanordnung orientiert sich an LocalAIs ImageGen-Seite, ohne deren Code zu kopieren.
### Chatprofile: GPU- und Sampling-Einstellungen
Der Profileditor speichert Kontextbudget, Slots, Batch/Microbatch, Temperature,
Top-p und Top-k sowie geordnete GPU-UUIDs, Split-Modus (`none`, `layer`, `row`)
und relative Verteilungsgewichte. Zwei GPU-Auswahlen zeigen die echten Kartennamen;
die Reihenfolge definiert die vorgesehenen logischen CUDA0/CUDA1-Geräte. UUIDs
verhindern Verwechslungen mit wechselnden nvidia-smi-Indizes. CPU-Threads stehen
unter „Erweitert“. Die Auswahl startet keinen Worker; die Chat-Ausführung ist
weiterhin nicht angebunden. Die GPU-Verteilung ist keine Speicherzusage.
Medium aus der Referenztabelle: Kontext 160000 insgesamt für zwei Slots,
RTX 5080 zuerst, RTX 3060 danach, Layer-Split 85,15, Batch 2048, Microbatch 256,
Temperature 1.0, Top-p 0.95, Top-k 20. Fast: 76800, ein Slot, nur RTX 5080,
keine Aufteilung, Batch 2048, Microbatch 64, Temperature 0.2, Top-p 0.8, Top-k 20.
API `profiles/save`: zusätzliche Chat-Parameter `gpu_devices` (geordnete UUID-Liste),
`split_mode`, `tensor_split` (Zahlenliste), `temperature`, `top_p`, `top_k`.
Leere Geräte-/Gewichtelisten bedeuten automatische Auswahl/Verteilung.
Alte Profile bleiben lesbar; fehlende neue Felder erhalten bei Anzeige/Speichern
Standardwerte (automatische Geräte, keine Aufteilung, Temperature 0.8, Top-p 0.95,
Top-k 40). Bestehende Dateien werden beim Lesen nicht umgeschrieben.