InternLM / InternLM/lmdeploy

lmdeploy + batch inference是推理加速的极限吗?

Open
#3,222 2 comments 0 reactions 1 assignee Claimed by @lvhan028 View on GitHub
Dominant language
Python
Stars
8.1k
Forks
748
Avg merge
6d 2h
Merged PRs (30d)
54

Description

开发者你好,如果不改变硬件设施也不使用量化模型的话,利用lmdeploy部署模型(用openai api推理),再在grpc服务端接一个batch inference的接口可以达到比较快的推理速度。
此外在服务端还有什么可以实施的加速方法吗?

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.