aws-samples / aws-samples/amazon-textract-code-samples

Unable to parse Document result in Python

未关闭
#39 0 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
主要语言
Jupyter Notebook
星标
449
派生
262
PR 合并指标
30 天内没有已合并 PR

描述

using textract-trp 0.1.3

When parsing "get_document_analysis" response the following output is generated:

```
Traceback (most recent call last):
File "G:\dev\OCR\main.py", line 17, in
result = (textract.receive_document_result('52c4a450c667a18d89f4e26a1cf4b56859ad239f1a63279bec8f60458ae2284e'))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\textract.py", line 62, in receive_document_result
return Document(response)
^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 633, in __init__
self._parse()
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 667, in _parse
page = Page(documentPage["Blocks"], self._blockMap)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 516, in __init__
self._parse(blockMap)
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 530, in _parse
l = Line(item, blockMap)
^^^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 142, in __init__
if(blockMap[cid]["BlockType"] == "WORD"):
~~~~~~~~^^^^^
KeyError: '9e2f5e38-f865-4b79-a37b-ac8ed7a19f02'
```

贡献指南

打开贡献指南

调研方向

首先复现 get_document_analysis 响应,并按照 traceback 中所示检查 trp/__init__.py 里 Document._parse、Page._parse 和 Line.__init__ 附近的代码。完成的标准是:响应能够在不出现报告中的 KeyError 的情况下完成解析,并且受影响的块引用情况由测试覆盖。

由索引模型根据 Issue 内容生成。

评估

技术栈
aws, python
领域
api, cloud
Issue 类型
缺陷
难度
3/5
预计耗时
1-2 天
活跃度
停滞
描述清晰度
基本清楚
新手友好度
35/100

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。