intel / intel/llm-scaler

Inference Qwen3-32B BUG for llm-scaler-vllm:0.14.0-b8.1

Open
#355 1 comment 0 reactions 1 assignee Claimed by @gc-fu View on GitHub
vllm
Dominant language
C++
Stars
529
Forks
80
Avg merge
9h 7m
Merged PRs (30d)
38

Description

vllm serving:
VLLM_OFFLOAD_WEIGHTS_BEFORE_QUANT=0 \
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
VLLM_WORKER_MULTIPROC_METHOD=spawn \
python3 -m vllm.entrypoints.openai.api_server \
--model /llm/models/Qwen3-32B \
--served-model-name Qwen3-32B \
--dtype=float16 \
--enforce-eager \
--port 8000 \
--host 0.0.0.0 \
--trust-remote-code \
--gpu-memory-util=0.9 \
--no-enable-prefix-caching \
--max-num-batched-tokens=8192 \
--max-num-seqs=20 \
--disable-log-requests \
--max-model-len 24576 \
--block-size 64 \
--quantization fp8 \
-tp=4
------------------------------------------------------------------------------------------
vllm serve command:
modelname=/llm/models/Qwen3-32B
output=1024

for bsize in 1 2 4 6 8 10 12 14 16 18 20; do
echo "benchmark serving bs${bsize}"
vllm bench serve \
--model $modelname \
--dataset-name custom \
--dataset-path /llm/models/fit2cloud/hb-input10k.jsonl \
--served-model-name Qwen3-32B \
--output-len=$output \
--ignore-eos \
--num-prompt $bsize \
--trust_remote_code \
--request-rate 2 \
--backend vllm \
--port=8000
done
------------------------------------------------------------------------------------------
when request concurrency is 16, server side will crash, log as below:
RuntimeError: Worker failed with error 'level_zero backend failed with error: 20 (UR_RESULT_ERROR_DEVICE_LOST)', please check the stack trace above for the root cause

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.