Unstructured-IO / Unstructured-IO/unstructured-python-client
bug: pdf splitting modifies returned csv elements
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 119
- Forks
- 22
- Merge moyen
- 1 j 21 h
- PR mergées (30 j)
- 1
Description
Describe the bug
When specifying output_format as csv, the response from the api is different when split_pdf_page is True or False. When False, the elements contain an extra metadata field: text_as_html. This also means the element id does not match.
To Reproduce
_test_unstructured_client/integration/test_decorators.py::test_integration_split_csv_response illustrates this, but is passing because it asserts on a shortened string.
Expected behavior
The response to be identical whether or not split_pdf_page is True or False.
Guide de contribution
Ouvrir le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez par test_unstructured_client/integration/test_decorators.py::test_integration_split_csv_response et remplacez son assertion abrégée par une comparaison qui expose le champ supplémentaire text_as_html et l’identifiant différent de l’élément. Suivez le traitement de la réponse CSV pour split_pdf_page=True et False ; le travail est terminé lorsque les deux réponses sont identiques et que le test d’intégration vérifie le résultat complet.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- api
- Type d'issue
- Bug
- Difficulté
- 2/5
- Temps estimé
- 1-3 heures
- Activité
- À l'abandon
- Clarté
- Clairement spécifiée
- Accessibilité débutants
- 62/100