aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing
Files with more than 200 pages are not completely extracted
- Vorherrschende Sprache
- Python
- Sterne
- 337
- Forks
- 159
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
I noticed a consistent problem with larger files(200+ pages)
PDF files with more than 200 pages are never completed extracted. The files either remain unprocessed(no analysis folder created) or just partially extracted(40-50 pages) even after 1-2 days. Files within 100 pages are extracted within 1-5 mins.
The process is not bombarded with many large files, the problem is same even if I upload one large file(200 pages) in day.
Please let me know if I am missing something for larger files.
Thank you
Beitragsleitfaden
Rechercherichtung
Beginne damit, das Problem mit einer einzelnen PDF-Datei mit mehr als 200 Seiten zu reproduzieren, und vergleiche sie anschließend mit einer Datei mit weniger als 100 Seiten, deren Verarbeitung erfolgreich abgeschlossen wird. Verfolge den Workflow der Dokumentverarbeitung, um festzustellen, warum die Extraktion stoppt oder kein Analyseordner erstellt wird; als abgeschlossen gilt die Aufgabe, wenn das vollständige große Dokument extrahiert und sein Analyseordner erstellt wurde.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- aws, python
- Bereich
- backend, cloud
- Issue-Typ
- Bug
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 35/100