aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing

Provided Test PDF in this project doesnt get extracted/analyzed

オープン
#45 コメント 3 件 リアクション 0 件 担当者 0 名 GitHub で見る

まだ誰も着手していません。

主要言語
Python
スター
337
フォーク
159
PR マージ指標
30日以内にマージされた PR はありません

説明

The pdfdoc.pdf in the testdocs folder in this project is a simple 1 page PDF. The document doesnt seem to complete extraction. DynamoDB status is InPROGRESS. No error messages in any of the Cloudwatch logs. Anyone know how to track down what the issue might be?

コントリビューションガイド

コントリビューションガイドを開く

はじめの一歩

  1. issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
  2. 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
  3. リポジトリをフォークし、ブランチを切って変更します。
  4. issue 番号を参照したプルリクエストを送ります。

調査の方向性

testdocs/pdfdoc.pdf から始め、その処理を DynamoDB のステータスと CloudWatch のログを通して追跡します。想定される抽出経路と、この 1 ページの PDF で実際に起きていることを比較し、処理が INPROGRESS のままになる理由を特定します。テストドキュメントの抽出が完了するか、失敗が有用なエラーとして表面化すれば完了です。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
aws, python
領域
backend, cloud
issue の種類
バグ
難易度
4/5
見積もり時間
3〜5日
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
30/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。