lmdeploy + batch inference是推理加速的极限吗?
Open
- Dominant language
- Python
- Stars
- 8.1k
- Forks
- 748
- Avg merge
- 6d 2h
- Merged PRs (30d)
- 54
Description
开发者你好,如果不改变硬件设施也不使用量化模型的话,利用lmdeploy部署模型(用openai api推理),再在grpc服务端接一个batch inference的接口可以达到比较快的推理速度。
此外在服务端还有什么可以实施的加速方法吗?
Contributor guide
Assessment
This issue has not been assessed yet.