aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing
Files with more than 200 pages are not completely extracted
- Lenguaje dominante
- Python
- Estrellas
- 337
- Forks
- 159
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
I noticed a consistent problem with larger files(200+ pages)
PDF files with more than 200 pages are never completed extracted. The files either remain unprocessed(no analysis folder created) or just partially extracted(40-50 pages) even after 1-2 days. Files within 100 pages are extracted within 1-5 mins.
The process is not bombarded with many large files, the problem is same even if I upload one large file(200 pages) in day.
Please let me know if I am missing something for larger files.
Thank you
Guía de contribución
Línea de trabajo
Comienza reproduciendo el problema con un único PDF de más de 200 páginas y, después, compáralo con un archivo de menos de 100 páginas que se completa correctamente. Sigue el flujo de trabajo de procesamiento de documentos para determinar por qué se detiene la extracción o no se crea ninguna carpeta de análisis; se considera terminado cuando se extrae el documento grande completo y se crea su carpeta de análisis.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- aws, python
- Área
- backend, cloud
- Tipo de issue
- Error
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 35/100