aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing

Files with more than 200 pages are not completely extracted

Abierto
#22 0 comentarios 1 reacción 0 asignados Ver en GitHub
Lenguaje dominante
Python
Estrellas
337
Forks
159
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

I noticed a consistent problem with larger files(200+ pages)
PDF files with more than 200 pages are never completed extracted. The files either remain unprocessed(no analysis folder created) or just partially extracted(40-50 pages) even after 1-2 days. Files within 100 pages are extracted within 1-5 mins.
The process is not bombarded with many large files, the problem is same even if I upload one large file(200 pages) in day.
Please let me know if I am missing something for larger files.
Thank you

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza reproduciendo el problema con un único PDF de más de 200 páginas y, después, compáralo con un archivo de menos de 100 páginas que se completa correctamente. Sigue el flujo de trabajo de procesamiento de documentos para determinar por qué se detiene la extracción o no se crea ninguna carpeta de análisis; se considera terminado cuando se extrae el documento grande completo y se crea su carpeta de análisis.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
aws, python
Área
backend, cloud
Tipo de issue
Error
Dificultad
4/5
Tiempo estimado
3-5 días
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
35/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.