Add owned OpenAI endpoint and coordinated native model switching
This commit is contained in:
@@ -141,8 +141,8 @@ Top-p und Top-k sowie geordnete GPU-UUIDs, Split-Modus (`none`, `layer`, `row`)
|
||||
und relative Verteilungsgewichte. Zwei GPU-Auswahlen zeigen die echten Kartennamen;
|
||||
die Reihenfolge definiert die vorgesehenen logischen CUDA0/CUDA1-Geräte. UUIDs
|
||||
verhindern Verwechslungen mit wechselnden nvidia-smi-Indizes. CPU-Threads stehen
|
||||
unter „Erweitert“. Die Auswahl startet keinen Worker; die Chat-Ausführung ist
|
||||
weiterhin nicht angebunden. Die GPU-Verteilung ist keine Speicherzusage.
|
||||
unter „Erweitert“. Die Auswahl startet keinen Worker. Nach expliziter Freigabe am Endpunkt lädt
|
||||
der eigene Router das Profil bei einer Chat-Anfrage; siehe [ENDPOINT.md](ENDPOINT.md). Die GPU-Verteilung ist keine Speicherzusage.
|
||||
|
||||
Medium aus der Referenztabelle: Kontext 160000 insgesamt für zwei Slots,
|
||||
RTX 5080 zuerst, RTX 3060 danach, Layer-Split 85,15, Batch 2048, Microbatch 256,
|
||||
|
||||
Reference in New Issue
Block a user