aws-samples / aws-samples/amazon-textract-code-samples
Unable to parse Document result in Python
- 主要语言
- Jupyter Notebook
- 星标
- 449
- 派生
- 262
- PR 合并指标
- 30 天内没有已合并 PR
描述
using textract-trp 0.1.3
When parsing "get_document_analysis" response the following output is generated:
```
Traceback (most recent call last):
File "G:\dev\OCR\main.py", line 17, in
result = (textract.receive_document_result('52c4a450c667a18d89f4e26a1cf4b56859ad239f1a63279bec8f60458ae2284e'))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\textract.py", line 62, in receive_document_result
return Document(response)
^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 633, in __init__
self._parse()
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 667, in _parse
page = Page(documentPage["Blocks"], self._blockMap)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 516, in __init__
self._parse(blockMap)
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 530, in _parse
l = Line(item, blockMap)
^^^^^^^^^^^^^^^^^^^^
File "G:\dev\OCR\venv\Lib\site-packages\trp\__init__.py", line 142, in __init__
if(blockMap[cid]["BlockType"] == "WORD"):
~~~~~~~~^^^^^
KeyError: '9e2f5e38-f865-4b79-a37b-ac8ed7a19f02'
```
贡献指南
调研方向
首先复现 get_document_analysis 响应,并按照 traceback 中所示检查 trp/__init__.py 里 Document._parse、Page._parse 和 Line.__init__ 附近的代码。完成的标准是:响应能够在不出现报告中的 KeyError 的情况下完成解析,并且受影响的块引用情况由测试覆盖。
由索引模型根据 Issue 内容生成。
评估
- 技术栈
- aws, python
- 领域
- api, cloud
- Issue 类型
- 缺陷
- 难度
- 3/5
- 预计耗时
- 1-2 天
- 活跃度
- 停滞
- 描述清晰度
- 基本清楚
- 新手友好度
- 35/100