Enable benchmarked two-slot medium profile

This commit is contained in:
Mikei386
2026-08-30 20:54:22 +02:00
parent db3719af7a
commit a41d6dc28c
7 changed files with 60 additions and 21 deletions
+7 -1
View File
@@ -82,7 +82,7 @@ FAST_UBATCH_SIZE=32
MEDIUM_CONTEXT=160000
MEDIUM_BATCH_SIZE=2048
MEDIUM_UBATCH_SIZE=128
MEDIUM_TENSOR_SPLIT=90,10
MEDIUM_TENSOR_SPLIT=85,15
LARGE_CONTEXT=192000
LARGE_BATCH_SIZE=2048
LARGE_UBATCH_SIZE=128
@@ -99,6 +99,12 @@ UNCENSORED_MTP_MAX=2
EXPERIMENTAL_CONTEXT=76800
LLAMA_THREADS=6
LLAMA_THREADS_BATCH=6
FAST_PARALLEL_SLOTS=1
MEDIUM_PARALLEL_SLOTS=2
LARGE_PARALLEL_SLOTS=1
ULTRA_PARALLEL_SLOTS=1
UNCENSORED_PARALLEL_SLOTS=1
EXPERIMENTAL_PARALLEL_SLOTS=1
PIPER_TTS_VERSION=1.6.0
PIPER_VOICE=de_DE-thorsten-high
XTTS_IMAGE=ghcr.io/coqui-ai/xtts-streaming-server:latest-cuda121@sha256:f7fb3b1f9d4bc88af94da1b5959d8002f1e0b003c97557164034eb8a29f01b90
+6 -1
View File
@@ -7,6 +7,7 @@
"id": "fast",
"alias": "qwen-fast",
"context": 76800,
"parallel_slots": 1,
"model_env": "FAST_MODEL_FILE",
"model_family": "Qwen3.8-27B IQ4 Mix",
"gpu_split": "5080 only",
@@ -18,9 +19,10 @@
"id": "medium",
"alias": "qwen-medium",
"context": 160000,
"parallel_slots": 2,
"model_env": "MEDIUM_MODEL_FILE",
"model_family": "Qwen3.8-27B IQ4 XS Pure",
"gpu_split": "90:10",
"gpu_split": "85:15",
"vision": true,
"mtp": 3,
"description": "Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben."
@@ -29,6 +31,7 @@
"id": "large",
"alias": "qwen-large",
"context": 192000,
"parallel_slots": 1,
"model_env": "LARGE_MODEL_FILE",
"model_family": "Qwen3.8-27B IQ4 XS Pure",
"gpu_split": "86:14",
@@ -40,6 +43,7 @@
"id": "ultra",
"alias": "qwen-ultra",
"context": 262144,
"parallel_slots": 1,
"model_env": "ULTRA_MODEL_FILE",
"model_family": "Qwen3.8-27B IQ4 XS Pure",
"gpu_split": "80:20",
@@ -51,6 +55,7 @@
"id": "uncensored",
"alias": "qwen-uncensored",
"context": 80000,
"parallel_slots": 1,
"model_env": "UNCENSORED_MODEL_FILE",
"model_family": "Qwen3.8-27B Abliterated Q4_K_M",
"gpu_split": "90:10",