deepseek-ai / deepseek-ai/DeepSeek-OCR
关于图片中多个重复token识别出错的问题
Open
- Dominant language
- Python
- Stars
- 23.9k
- Forks
- 2.2k
- PR merge metrics
- No merged PRs in 30d
Description
我在进行单个图片OCR识别时,发现如果图片内有多个重复的token,识别出错概率会显著增加。
一个典型例子如下:
识别结果:
[result_ori.md](https://github.com/user-attachments/files/23160142/result_ori.md)
可以看到识别结果为数字1-365
实验在单卡A100上,使用vllm进行推理(python run_dpsk_ocr_image.py)
config使用默认Gundam设置,PROMPT = '\n<|grounding|>Convert the document to markdown.'
我想问一下是否有观察到类似现象?以及是否有一些解释,比如DeepEncoder是否编码了语义信息 or 字符level信息,否则为何输出看起来有规律?
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.