allenai / allenai/mmda

Box on pages in JSON seems nonsensical

未关闭
#32 3 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
主要语言
Jupyter Notebook
星标
166
派生
19
PR 合并指标
30 天内没有已合并 PR

描述

To reproduce (paths change as necessary):

```python
SSCRAPER="/workspaces/mmda/SymbolScraper/bin/sscraper"

import os
from mmda.parsers.symbol_scraper_parser import SymbolScraperParser
from mmda.types.document import Document

INPUT_PDF_PATH="/workspaces/mmda/docs/crater.pdf"
OUTPUT_JSON_PATH="/workspaces/mmda/output/crater.json"
TEMP_PATH="/workspaces/mmda/tmp"

ssparser = SymbolScraperParser(sscraper_bin_path=SSCRAPER)
doc: Document = ssparser.parse(
input_pdf_path=INPUT_PDF_PATH,
output_json_path=OUTPUT_JSON_PATH,
tempdir=TEMP_PATH
)
```

Then, inspect `crater.json` spans in pages seem wonky in terms of box boundaries (expected to be between 0 and 1 I think):

```json
"pages": [
{
"spans": [
{
"start": 0,
"end": 5980,
"box": [
0.05228758169934641,
-70608.52432885101,
0.8466750000000001,
70609.43707111111,
0
]
}
],
"id": 0
},
....
```

Here, crater.pdf refers to https://arxiv.org/pdf/1601.00978.pdf

贡献指南

这个仓库没有索引到贡献指南

评估

这个 Issue 还没有评估数据。

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。