aws-samples / aws-samples/amazon-textract-serverless-large-scale-document-processing

How to get particular page Form-data.

Abierto
#41 1 comentario 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
Python
Estrellas
337
Forks
159
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

I Have added the entire PDF file to S3Bucket via amazons3Client.PutObjectAsync method and started the analysis by textractClient.StartDocumentTextDetectionAsync method.
while getting the response by textractClient.GetDocumentTextDetectionAsync method I can see all pages data and could able to segregate the Raw/Line data.
My problem is, how can I get the FormData and TableData for a particular page(say I need FormData only for page no 3). Kindly advise on this.

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza revisando las llamadas S3 PutObjectAsync, Textract StartDocumentTextDetectionAsync y GetDocumentTextDetectionAsync descritas en el issue, junto con los puntos de entrada del repositorio para el procesamiento de documentos. Confirma cómo se representan los datos de formularios y tablas específicos de una página y, a continuación, documenta el enfoque compatible y un ejemplo claro y completo para la página 3.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
aws, python
Área
documentation
Tipo de issue
Documentación
Dificultad
3/5
Tiempo estimado
1-2 días
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
25/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.