deepseek-ai / deepseek-ai/DeepSeek-OCR

关于图片中多个重复token识别出错的问题

Open
#160 4 comments 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
23.9k
Forks
2.2k
PR merge metrics
No merged PRs in 30d

Description

我在进行单个图片OCR识别时,发现如果图片内有多个重复的token,识别出错概率会显著增加。
一个典型例子如下:
Image
识别结果:
[result_ori.md](https://github.com/user-attachments/files/23160142/result_ori.md)
可以看到识别结果为数字1-365
实验在单卡A100上,使用vllm进行推理(python run_dpsk_ocr_image.py)
config使用默认Gundam设置,PROMPT = '\n<|grounding|>Convert the document to markdown.'
我想问一下是否有观察到类似现象?以及是否有一些解释,比如DeepEncoder是否编码了语义信息 or 字符level信息,否则为何输出看起来有规律?

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.