aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing

Files with more than 200 pages are not completely extracted

Offen
#22 0 Kommentare 1 Reaktion 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Python
Sterne
337
Forks
159
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

I noticed a consistent problem with larger files(200+ pages)
PDF files with more than 200 pages are never completed extracted. The files either remain unprocessed(no analysis folder created) or just partially extracted(40-50 pages) even after 1-2 days. Files within 100 pages are extracted within 1-5 mins.
The process is not bombarded with many large files, the problem is same even if I upload one large file(200 pages) in day.
Please let me know if I am missing something for larger files.
Thank you

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Beginne damit, das Problem mit einer einzelnen PDF-Datei mit mehr als 200 Seiten zu reproduzieren, und vergleiche sie anschließend mit einer Datei mit weniger als 100 Seiten, deren Verarbeitung erfolgreich abgeschlossen wird. Verfolge den Workflow der Dokumentverarbeitung, um festzustellen, warum die Extraktion stoppt oder kein Analyseordner erstellt wird; als abgeschlossen gilt die Aufgabe, wenn das vollständige große Dokument extrahiert und sein Analyseordner erstellt wurde.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
aws, python
Bereich
backend, cloud
Issue-Typ
Bug
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.