74 lines
1.1 KiB
JSON
74 lines
1.1 KiB
JSON
[
|
|
"--model",
|
|
"/models/qwen3.8-27b-iq4-xs-pure/qwen3.8-27b-IQ4_XS-pure.gguf",
|
|
"--mmproj",
|
|
"/models/qwen/mmproj-BF16.gguf",
|
|
"--mmproj-offload",
|
|
"--mmproj-device",
|
|
"CUDA1",
|
|
"--alias",
|
|
"qwen-large",
|
|
"--ctx-size",
|
|
"192000",
|
|
"--flash-attn",
|
|
"on",
|
|
"--cache-type-k",
|
|
"q4_0",
|
|
"--cache-type-v",
|
|
"q4_0",
|
|
"--cache-prompt",
|
|
"--cache-ram",
|
|
"32768",
|
|
"--threads",
|
|
"6",
|
|
"--threads-batch",
|
|
"6",
|
|
"--batch-size",
|
|
"2048",
|
|
"--ubatch-size",
|
|
"256",
|
|
"--parallel",
|
|
"1",
|
|
"--kv-unified",
|
|
"--jinja",
|
|
"--reasoning",
|
|
"auto",
|
|
"--reasoning-preserve",
|
|
"--host",
|
|
"127.0.0.1",
|
|
"--port",
|
|
"5005",
|
|
"--metrics",
|
|
"--fit",
|
|
"off",
|
|
"--n-gpu-layers",
|
|
"all",
|
|
"--load-mode",
|
|
"none",
|
|
"--no-ui",
|
|
"--temperature",
|
|
"0.2",
|
|
"--top-p",
|
|
"0.8",
|
|
"--top-k",
|
|
"20",
|
|
"--device",
|
|
"CUDA0,CUDA1",
|
|
"--main-gpu",
|
|
"0",
|
|
"--split-mode",
|
|
"layer",
|
|
"--tensor-split",
|
|
"86,14",
|
|
"--spec-type",
|
|
"draft-mtp",
|
|
"--spec-draft-n-max",
|
|
"2",
|
|
"--spec-draft-type-k",
|
|
"f16",
|
|
"--spec-draft-type-v",
|
|
"f16",
|
|
"--verbosity",
|
|
"3"
|
|
]
|