InternLM / InternLM/lmdeploy

多轮对话批处理耗时异常

Open
#1,901 2 comments 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
8.1k
Forks
748
Avg merge
6d 2h
Merged PRs (30d)
54

Description

作者大大您好,我在使用DeepSeek-vl-7B多轮对话:第一轮中的第一张图作为one-shot案例,然后第二轮的第二张图需要模型根据第一轮的example进行描述。在这个过程中,大概耗时2-5秒,属于合理范围。如下:
![6bff08173ab0f470fb663d2ea9cf0fc8](https://github.com/InternLM/lmdeploy/assets/134385878/f991e552-0087-422f-8a90-103ba0bf68e5)

然后我将这个[prompt] * 512,即变成批次处理,大概耗时250多秒,如下:
![70d58b9aefa85375d96ff2574bdb91d0](https://github.com/InternLM/lmdeploy/assets/134385878/e6dc759e-e17a-4404-9fa1-85d3c1d423dc)

但是,问题来了,我处理不同的512张图片时,即第二轮需要模型生成的内容中,一个批次512个采用了512张图片,生成速度却异常慢,如下:
![0fa7a5fbb66792d77ff8c0c7b2b989ff](https://github.com/InternLM/lmdeploy/assets/134385878/8b5530ff-7d4e-4b7b-b6a0-a56d0d737f1b)

请问这是多轮推理效率的问题吗还是其他原因呢?

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.