Add Qwen GSQ-RCO Beta 1 profile
This commit is contained in:
+83
-1
@@ -235,6 +235,88 @@ services:
|
||||
- --spec-draft-p-min
|
||||
- "0.05"
|
||||
|
||||
# Beta 1 keeps the complete GSQ-RCO text model and KV cache on the RTX 5080.
|
||||
# Only the multimodal projector runs on the RTX 3060. The measured hard
|
||||
# boundary is 196608 tokens; 192K deliberately retains runtime headroom.
|
||||
llama-beta1:
|
||||
<<: *llama-common
|
||||
container_name: mike-ai-llama-beta1
|
||||
labels:
|
||||
com.mike-ai.llama-profile: beta1
|
||||
environment:
|
||||
NVIDIA_VISIBLE_DEVICES: ${BETA1_GPU_DEVICES:-0,1}
|
||||
NVIDIA_DRIVER_CAPABILITIES: compute,utility
|
||||
MTMD_BACKEND_DEVICE: CUDA1
|
||||
command:
|
||||
- --model
|
||||
- "/models/${BETA1_MODEL_FILE:?BETA1_MODEL_FILE is required}"
|
||||
- --mmproj
|
||||
- "/models/${VISION_PROJECTOR_FILE:?VISION_PROJECTOR_FILE is required}"
|
||||
- --mmproj-offload
|
||||
- --mmproj-device
|
||||
- CUDA1
|
||||
- --alias
|
||||
- qwen-beta-1
|
||||
- --ctx-size
|
||||
- "${BETA1_CONTEXT:-192000}"
|
||||
- --flash-attn
|
||||
- "on"
|
||||
- --cache-type-k
|
||||
- q4_0
|
||||
- --cache-type-v
|
||||
- q4_0
|
||||
- --cache-prompt
|
||||
- --cache-ram
|
||||
- "${LLAMA_CACHE_RAM_MIB:-32768}"
|
||||
- --threads
|
||||
- "${LLAMA_THREADS:-6}"
|
||||
- --threads-batch
|
||||
- "${LLAMA_THREADS_BATCH:-6}"
|
||||
- --batch-size
|
||||
- "${BETA1_BATCH_SIZE:-2048}"
|
||||
- --ubatch-size
|
||||
- "${BETA1_UBATCH_SIZE:-128}"
|
||||
- --parallel
|
||||
- "${BETA1_PARALLEL_SLOTS:-1}"
|
||||
- --kv-unified
|
||||
- --jinja
|
||||
- --reasoning
|
||||
- auto
|
||||
- --reasoning-preserve
|
||||
- --host
|
||||
- 0.0.0.0
|
||||
- --port
|
||||
- "8080"
|
||||
- --metrics
|
||||
- --fit
|
||||
- "off"
|
||||
- --n-gpu-layers
|
||||
- all
|
||||
- --no-mmap
|
||||
- --no-ui
|
||||
- --temperature
|
||||
- "1.0"
|
||||
- --top-p
|
||||
- "0.95"
|
||||
- --top-k
|
||||
- "20"
|
||||
- --device
|
||||
- CUDA0
|
||||
- --main-gpu
|
||||
- "0"
|
||||
- --split-mode
|
||||
- none
|
||||
- --spec-type
|
||||
- draft-mtp
|
||||
- --spec-draft-n-max
|
||||
- "3"
|
||||
- --spec-draft-type-k
|
||||
- f16
|
||||
- --spec-draft-type-v
|
||||
- f16
|
||||
- --spec-draft-p-min
|
||||
- "0.05"
|
||||
|
||||
llama-large:
|
||||
<<: *llama-common
|
||||
container_name: mike-ai-llama-large
|
||||
@@ -487,7 +569,7 @@ services:
|
||||
- /var/run/docker.sock:/var/run/docker.sock
|
||||
environment:
|
||||
CONTROLLER_TOKEN: "${CONTROLLER_TOKEN:?CONTROLLER_TOKEN is required}"
|
||||
ALLOWED_PROFILES: fast,medium,large,ultra,uncensored
|
||||
ALLOWED_PROFILES: fast,medium,beta1,large,ultra,uncensored
|
||||
IMAGE_WORKER: image
|
||||
networks: [control]
|
||||
security_opt: ["no-new-privileges:true"]
|
||||
|
||||
Reference in New Issue
Block a user