Box on pages in JSON seems nonsensical
- 主要语言
- Jupyter Notebook
- 星标
- 166
- 派生
- 19
- PR 合并指标
- 30 天内没有已合并 PR
描述
To reproduce (paths change as necessary):
```python
SSCRAPER="/workspaces/mmda/SymbolScraper/bin/sscraper"
import os
from mmda.parsers.symbol_scraper_parser import SymbolScraperParser
from mmda.types.document import Document
INPUT_PDF_PATH="/workspaces/mmda/docs/crater.pdf"
OUTPUT_JSON_PATH="/workspaces/mmda/output/crater.json"
TEMP_PATH="/workspaces/mmda/tmp"
ssparser = SymbolScraperParser(sscraper_bin_path=SSCRAPER)
doc: Document = ssparser.parse(
input_pdf_path=INPUT_PDF_PATH,
output_json_path=OUTPUT_JSON_PATH,
tempdir=TEMP_PATH
)
```
Then, inspect `crater.json` spans in pages seem wonky in terms of box boundaries (expected to be between 0 and 1 I think):
```json
"pages": [
{
"spans": [
{
"start": 0,
"end": 5980,
"box": [
0.05228758169934641,
-70608.52432885101,
0.8466750000000001,
70609.43707111111,
0
]
}
],
"id": 0
},
....
```
Here, crater.pdf refers to https://arxiv.org/pdf/1601.00978.pdf
贡献指南
这个仓库没有索引到贡献指南
评估
这个 Issue 还没有评估数据。