deepseek-ai / deepseek-ai/DeepSeek-OCR

完整layout类别和阅读顺序信息

Open
#166 1 comment 1 reaction 0 assignees View on GitHub
Dominant language
Python
Stars
23.9k
Forks
2.2k
PR merge metrics
No merged PRs in 30d

Description

一个案例的输出结果如下:

<|ref|>sub_title<|/ref|><|det|>[[77, 70, 235, 100]]<|/det|>
3 功能示意图

<|ref|>image<|/ref|><|det|>[[70, 133, 925, 515]]<|/det|>

<|ref|>table<|/ref|><|det|>[[72, 518, 923, 737]]<|/det|>

电源开关

<|ref|>table_footnote<|/ref|><|det|>[[72, 738, 920, 772]]<|/det|>
[1]在APP中,可以看到更加精确的提示。

<|ref|>table<|/ref|><|det|>[[73, 830, 921, 931]]<|/det|>
<|ref|>table_caption<|/ref|><|det|>[[78, 803, 486, 826]]<|/det|>
模式:请在APP中切换模式。

1、想问下以上这样的信息就是模型直接的输出是吗,模型的输出有没有比如阅读顺序这样的其他输出内容
2、<|ref|>和<|/ref|>标签之间的就是layout类别信息是吗,想问下DeepSeek-OCR一共支持多少种layout类别信息,具体包括哪些呢

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.