aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing
Provided Test PDF in this project doesnt get extracted/analyzed
オープン
まだ誰も着手していません。
- 主要言語
- Python
- スター
- 337
- フォーク
- 159
- PR マージ指標
- 30日以内にマージされた PR はありません
説明
The pdfdoc.pdf in the testdocs folder in this project is a simple 1 page PDF. The document doesnt seem to complete extraction. DynamoDB status is InPROGRESS. No error messages in any of the Cloudwatch logs. Anyone know how to track down what the issue might be?
コントリビューションガイド
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
調査の方向性
testdocs/pdfdoc.pdf から始め、その処理を DynamoDB のステータスと CloudWatch のログを通して追跡します。想定される抽出経路と、この 1 ページの PDF で実際に起きていることを比較し、処理が INPROGRESS のままになる理由を特定します。テストドキュメントの抽出が完了するか、失敗が有用なエラーとして表面化すれば完了です。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- aws, python
- 領域
- backend, cloud
- issue の種類
- バグ
- 難易度
- 4/5
- 見積もり時間
- 3〜5日
- 活発さ
- 停滞
- 明瞭さ
- 説明が足りない
- 初心者へのやさしさ
- 30/100