Inference Qwen3-32B BUG for llm-scaler-vllm:0.14.0-b8.1
- Dominant language
- C++
- Stars
- 529
- Forks
- 80
- Avg merge
- 9h 7m
- Merged PRs (30d)
- 38
Description
vllm serving:
VLLM_OFFLOAD_WEIGHTS_BEFORE_QUANT=0 \
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
VLLM_WORKER_MULTIPROC_METHOD=spawn \
python3 -m vllm.entrypoints.openai.api_server \
--model /llm/models/Qwen3-32B \
--served-model-name Qwen3-32B \
--dtype=float16 \
--enforce-eager \
--port 8000 \
--host 0.0.0.0 \
--trust-remote-code \
--gpu-memory-util=0.9 \
--no-enable-prefix-caching \
--max-num-batched-tokens=8192 \
--max-num-seqs=20 \
--disable-log-requests \
--max-model-len 24576 \
--block-size 64 \
--quantization fp8 \
-tp=4
------------------------------------------------------------------------------------------
vllm serve command:
modelname=/llm/models/Qwen3-32B
output=1024
for bsize in 1 2 4 6 8 10 12 14 16 18 20; do
echo "benchmark serving bs${bsize}"
vllm bench serve \
--model $modelname \
--dataset-name custom \
--dataset-path /llm/models/fit2cloud/hb-input10k.jsonl \
--served-model-name Qwen3-32B \
--output-len=$output \
--ignore-eos \
--num-prompt $bsize \
--trust_remote_code \
--request-rate 2 \
--backend vllm \
--port=8000
done
------------------------------------------------------------------------------------------
when request concurrency is 16, server side will crash, log as below:
RuntimeError: Worker failed with error 'level_zero backend failed with error: 20 (UR_RESULT_ERROR_DEVICE_LOST)', please check the stack trace above for the root cause
Contributor guide
Assessment
This issue has not been assessed yet.