171 lines
3.7 KiB
JSON
171 lines
3.7 KiB
JSON
{
|
|
"case": {
|
|
"id": "04-latest-fast-76k-mtp2-p000",
|
|
"model": "iq4-mix",
|
|
"context": 76800,
|
|
"split": null,
|
|
"projector": "gpu",
|
|
"mtp": true,
|
|
"mtp_max": 2,
|
|
"quality": false,
|
|
"long_fill": 0.0,
|
|
"vision": false
|
|
},
|
|
"model_path": "/models/qwen3.8-27b-iq4-mix/Qwen3.8-27B-IQ4-MIX.gguf",
|
|
"started": "2026-08-22T21:20:55.266458+00:00",
|
|
"command": [
|
|
"docker",
|
|
"run",
|
|
"-d",
|
|
"--name",
|
|
"mike-ai-qwen38-dualgpu-bench",
|
|
"--gpus",
|
|
"all",
|
|
"--ipc",
|
|
"host",
|
|
"--read-only",
|
|
"--tmpfs",
|
|
"/tmp:size=1g,mode=1777",
|
|
"--security-opt",
|
|
"no-new-privileges:true",
|
|
"--cap-drop",
|
|
"ALL",
|
|
"-e",
|
|
"NVIDIA_VISIBLE_DEVICES=GPU-8ad38c6c-5a01-9d8e-1dfa-ed662ad78fbe",
|
|
"-v",
|
|
"/data/models:/models:ro",
|
|
"-p",
|
|
"127.0.0.1:18099:8080",
|
|
"-e",
|
|
"MTMD_BACKEND_DEVICE=CUDA1",
|
|
"mike-ai/llama.cpp:3f545bec-test",
|
|
"--model",
|
|
"/models/qwen3.8-27b-iq4-mix/Qwen3.8-27B-IQ4-MIX.gguf",
|
|
"--alias",
|
|
"04-latest-fast-76k-mtp2-p000",
|
|
"--ctx-size",
|
|
"76800",
|
|
"--flash-attn",
|
|
"on",
|
|
"--cache-type-k",
|
|
"q4_0",
|
|
"--cache-type-v",
|
|
"q4_0",
|
|
"--threads",
|
|
"6",
|
|
"--threads-batch",
|
|
"6",
|
|
"--batch-size",
|
|
"64",
|
|
"--ubatch-size",
|
|
"32",
|
|
"--parallel",
|
|
"1",
|
|
"--jinja",
|
|
"--reasoning",
|
|
"auto",
|
|
"--reasoning-budget",
|
|
"768",
|
|
"--host",
|
|
"0.0.0.0",
|
|
"--port",
|
|
"8080",
|
|
"--metrics",
|
|
"--fit",
|
|
"off",
|
|
"--n-gpu-layers",
|
|
"all",
|
|
"--no-mmap",
|
|
"--no-ui",
|
|
"--temperature",
|
|
"0.2",
|
|
"--top-p",
|
|
"0.8",
|
|
"--top-k",
|
|
"20",
|
|
"--device",
|
|
"CUDA0",
|
|
"--split-mode",
|
|
"none",
|
|
"--mmproj",
|
|
"/models/qwen3.8-27b-nvfp4/mmproj-BF16.gguf",
|
|
"--image-min-tokens",
|
|
"1024",
|
|
"--spec-type",
|
|
"draft-mtp",
|
|
"--spec-draft-n-max",
|
|
"2",
|
|
"--spec-draft-type-k",
|
|
"f16",
|
|
"--spec-draft-type-v",
|
|
"f16",
|
|
"--mmproj-device",
|
|
"CUDA1"
|
|
],
|
|
"docker_launch_returncode": 0,
|
|
"docker_launch_stderr": "",
|
|
"loaded": true,
|
|
"load_seconds": 4.056,
|
|
"gpu_after_load": [
|
|
{
|
|
"index": "0",
|
|
"name": "NVIDIA GeForce RTX 3060",
|
|
"uuid": "GPU-4834d9d7-5b61-3004-1fb3-4ae49d482d4b",
|
|
"total_mib": "12288",
|
|
"used_mib": "1251",
|
|
"free_mib": "10659",
|
|
"temperature_c": "42",
|
|
"power_w": "37.55"
|
|
},
|
|
{
|
|
"index": "1",
|
|
"name": "NVIDIA GeForce RTX 5080",
|
|
"uuid": "GPU-8ad38c6c-5a01-9d8e-1dfa-ed662ad78fbe",
|
|
"total_mib": "16303",
|
|
"used_mib": "15796",
|
|
"free_mib": "86",
|
|
"temperature_c": "55",
|
|
"power_w": "63.49"
|
|
}
|
|
],
|
|
"speed_runs": [
|
|
{
|
|
"tokens": 384,
|
|
"timings": {
|
|
"cache_n": 0,
|
|
"prompt_n": 28,
|
|
"prompt_ms": 153.99,
|
|
"prompt_per_token_ms": 5.499642857142858,
|
|
"prompt_per_second": 181.82998896032208,
|
|
"predicted_n": 384,
|
|
"predicted_ms": 4477.73,
|
|
"predicted_per_token_ms": 11.691201044386421,
|
|
"predicted_per_second": 85.53441140935251,
|
|
"draft_n": 348,
|
|
"draft_n_accepted": 209
|
|
}
|
|
},
|
|
{
|
|
"tokens": 384,
|
|
"timings": {
|
|
"cache_n": 0,
|
|
"prompt_n": 28,
|
|
"prompt_ms": 101.423,
|
|
"prompt_per_token_ms": 3.62225,
|
|
"prompt_per_second": 276.0715025191525,
|
|
"predicted_n": 384,
|
|
"predicted_ms": 4466.939,
|
|
"predicted_per_token_ms": 11.663026109660576,
|
|
"predicted_per_second": 85.7410410126487,
|
|
"draft_n": 348,
|
|
"draft_n_accepted": 209
|
|
}
|
|
}
|
|
],
|
|
"mean_predicted_tps": 85.6377262110006,
|
|
"status": "complete",
|
|
"server_log": "/data/benchmarks/qwen38-final-acceptance-20260822/cases/04-latest-fast-76k-mtp2-p000/server.log",
|
|
"oom": false,
|
|
"finished": "2026-08-22T21:21:09.682589+00:00"
|
|
}
|