Add owned OpenAI endpoint and coordinated native model switching

This commit is contained in:
Mikei386
2026-09-28 20:24:12 +02:00
parent 8d03a9a979
commit ff5d36252a
25 changed files with 952 additions and 177 deletions
+2 -2
View File
@@ -141,8 +141,8 @@ Top-p und Top-k sowie geordnete GPU-UUIDs, Split-Modus (`none`, `layer`, `row`)
und relative Verteilungsgewichte. Zwei GPU-Auswahlen zeigen die echten Kartennamen;
die Reihenfolge definiert die vorgesehenen logischen CUDA0/CUDA1-Geräte. UUIDs
verhindern Verwechslungen mit wechselnden nvidia-smi-Indizes. CPU-Threads stehen
unter „Erweitert“. Die Auswahl startet keinen Worker; die Chat-Ausführung ist
weiterhin nicht angebunden. Die GPU-Verteilung ist keine Speicherzusage.
unter „Erweitert“. Die Auswahl startet keinen Worker. Nach expliziter Freigabe am Endpunkt lädt
der eigene Router das Profil bei einer Chat-Anfrage; siehe [ENDPOINT.md](ENDPOINT.md). Die GPU-Verteilung ist keine Speicherzusage.
Medium aus der Referenztabelle: Kontext 160000 insgesamt für zwei Slots,
RTX 5080 zuerst, RTX 3060 danach, Layer-Split 85,15, Batch 2048, Microbatch 256,