aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing
Files with more than 200 pages are not completely extracted
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 337
- Forks
- 159
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
I noticed a consistent problem with larger files(200+ pages)
PDF files with more than 200 pages are never completed extracted. The files either remain unprocessed(no analysis folder created) or just partially extracted(40-50 pages) even after 1-2 days. Files within 100 pages are extracted within 1-5 mins.
The process is not bombarded with many large files, the problem is same even if I upload one large file(200 pages) in day.
Please let me know if I am missing something for larger files.
Thank you
Guide de contribution
Ouvrir le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez par reproduire le problème avec un seul PDF de plus de 200 pages, puis comparez-le avec un fichier de moins de 100 pages qui se termine correctement. Suivez le workflow de traitement des documents afin de déterminer pourquoi l’extraction s’arrête ou pourquoi aucun dossier d’analyse n’est créé ; le travail est considéré comme terminé lorsque l’intégralité du document volumineux est extraite et que son dossier d’analyse est créé.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- aws, python
- Domaine
- backend, cloud
- Type d'issue
- Bug
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 35/100