deepseek-ai / deepseek-ai/DeepSeek-Coder

用vllm加速推理框架 推理速度还是很慢

Open
#161 1 comment 1 reaction 0 assignees View on GitHub
Dominant language
Python
Stars
24.3k
Forks
2.9k
PR merge metrics
No merged PRs in 30d

Description

本地部署的deepseek-coder-33b,两块RTX A6000 48G的显卡
python -m vllm.entrypoints.openai.api_server --model /home/superadmin/coder33b --trust-remote-code --tensor-parallel-size=2 --served-model-name=deepseek-coder
启动后调用/v1/completions接口获取推理结果,但是效率极低,平均15tokens/s,如图
![image](https://github.com/deepseek-ai/DeepSeek-Coder/assets/18474897/b37e19c0-66b1-4410-bd00-1a4ed6e17243)

有人遇到过吗,如何解决有大佬指教吗

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.