Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
Expand Up @@ -5,7 +5,7 @@ base:
name: minimaxm3-fp4-b200-vllm-agentic
model:
path: hf:nvidia/MiniMax-M3-NVFP4
container: vllm/vllm-openai:nightly-1dc464d42681d22f38caf1fdc1eb632dc4421c45
container: vllm/vllm-openai:nightly-29468dde8b515031dc6d4d9d06bf0a2fa0442098
precision: fp4
resources:
gpu_type: b200
Expand All @@ -30,10 +30,11 @@ base:
workers: 1
args:
served-model-name: nvidia/MiniMax-M3-NVFP4
gpu-memory-utilization: 0.9
gpu-memory-utilization: 0.95
block-size: 128
language-model-only: true
enable-prefix-caching: true
enable-chunked-prefill: true
no-enable-flashinfer-autotune: true
reasoning-parser: minimax_m3
tool-call-parser: minimax_m3
Expand All @@ -47,7 +48,7 @@ base:
trust-remote-code: true
# Three-token EAGLE3 with the GQA draft head. Throughput runs switch to
# synthetic rejection at the golden acceptance length.
speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}'
speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASHINFER"}'
env:
PYTHONNOUSERSITE: '1'
VLLM_ENGINE_READY_TIMEOUT_S: '3600'
Expand All @@ -61,13 +62,15 @@ base:
AIPERF_REQUIRED_SERVER_METRIC_PREFIX: 'vllm:'

# One variant per point. DRAM points give SimpleCPUOffload the whole host budget
# (TOTAL_CPU_DRAM_GB GiB) with lazy offload.
# (TOTAL_CPU_DRAM_GB decimal GB) with lazy offload.
override_tp8_c1:
roles:
agg:
gpus: 8
args:
tensor-parallel-size: 8
max-num-seqs: 2
max-cudagraph-capture-size: 8
benchmark:
env:
CONC: '1'
Expand All @@ -79,6 +82,8 @@ override_tp4_c1:
gpus: 4
args:
tensor-parallel-size: 4
max-num-seqs: 2
max-cudagraph-capture-size: 8
benchmark:
env:
CONC: '1'
Expand All @@ -90,6 +95,8 @@ override_tp4_c5:
gpus: 4
args:
tensor-parallel-size: 4
max-num-seqs: 10
max-cudagraph-capture-size: 40
benchmark:
env:
CONC: '5'
Expand All @@ -101,6 +108,8 @@ override_tp4_c10:
gpus: 4
args:
tensor-parallel-size: 4
max-num-seqs: 20
max-cudagraph-capture-size: 80
benchmark:
env:
CONC: '10'
Expand All @@ -112,6 +121,8 @@ override_tp4_c15:
gpus: 4
args:
tensor-parallel-size: 4
max-num-seqs: 30
max-cudagraph-capture-size: 120
benchmark:
env:
CONC: '15'
Expand All @@ -123,6 +134,8 @@ override_tp4_c20:
gpus: 4
args:
tensor-parallel-size: 4
max-num-seqs: 40
max-cudagraph-capture-size: 160
benchmark:
env:
CONC: '20'
Expand All @@ -134,7 +147,9 @@ override_tp4_c15_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 30
max-cudagraph-capture-size: 120
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -149,7 +164,9 @@ override_tp4_c20_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 40
max-cudagraph-capture-size: 160
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -164,7 +181,9 @@ override_tp4_c25_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 50
max-cudagraph-capture-size: 200
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -179,7 +198,9 @@ override_tp4_c30_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 60
max-cudagraph-capture-size: 240
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -194,7 +215,9 @@ override_tp4_c32_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 64
max-cudagraph-capture-size: 256
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -209,7 +232,9 @@ override_tp4_c34_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 68
max-cudagraph-capture-size: 272
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -224,7 +249,9 @@ override_tp4_c36_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 72
max-cudagraph-capture-size: 288
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -239,7 +266,9 @@ override_tp4_c38_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 76
max-cudagraph-capture-size: 304
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand All @@ -254,7 +283,9 @@ override_tp4_c40_dram:
gpus: 4
args:
tensor-parallel-size: 4
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1161788653568,"lazy_offload":true}}'
max-num-seqs: 80
max-cudagraph-capture-size: 320
kv-transfer-config: '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use":1082000000000,"lazy_offload":true}}'
env:
VLLM_USE_SIMPLE_KV_OFFLOAD: '1'
benchmark:
Expand Down
Loading
Loading