deepseek-ai / deepseek-ai/DeepSeek-OCR
完整layout类别和阅读顺序信息
Open
- Dominant language
- Python
- Stars
- 23.9k
- Forks
- 2.2k
- PR merge metrics
- No merged PRs in 30d
Description
一个案例的输出结果如下:
<|ref|>sub_title<|/ref|><|det|>[[77, 70, 235, 100]]<|/det|>
3 功能示意图
<|ref|>image<|/ref|><|det|>[[70, 133, 925, 515]]<|/det|>
<|ref|>table<|/ref|><|det|>[[72, 518, 923, 737]]<|/det|>
电源开关
<|ref|>table_footnote<|/ref|><|det|>[[72, 738, 920, 772]]<|/det|>
[1]在APP中,可以看到更加精确的提示。
<|ref|>table<|/ref|><|det|>[[73, 830, 921, 931]]<|/det|>
<|ref|>table_caption<|/ref|><|det|>[[78, 803, 486, 826]]<|/det|>
模式:请在APP中切换模式。
1、想问下以上这样的信息就是模型直接的输出是吗,模型的输出有没有比如阅读顺序这样的其他输出内容
2、<|ref|>和<|/ref|>标签之间的就是layout类别信息是吗,想问下DeepSeek-OCR一共支持多少种layout类别信息,具体包括哪些呢
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.