Unable to read a parquet file
- Langage dominant
- Java
- Étoiles
- 3.1k
- Forks
- 1.6k
- Merge moyen
- 3 j 12 h
- PR mergées (30 j)
- 33
Description
I am unable to read a parquet file that was made after converting a csv to a parquet file using pyarrow. Following is the error
ArrowIOError Traceback (most recent call last) in () ~/anaconda3/lib/python3.6/site-packages/pyarrow/parquet.py in read_table(source, columns, nthreads, metadata, use_pandas_metadata) 937 return fs.read_parquet(source, columns=columns, metadata=metadata) 938 --> 939 pf = ParquetFile(source, metadata=metadata) 940 return pf.read(columns=columns, nthreads=nthreads, 941 use_pandas_metadata=use_pandas_metadata) ~/anaconda3/lib/python3.6/site-packages/pyarrow/parquet.py in __init__(self, source, metadata, common_metadata) 62 self.reader = ParquetReader() 63 source = _ensure_file(source) ---> 64 self.reader.open(source, metadata=metadata) 65 self.common_metadata = common_metadata 66 self._nested_paths_by_prefix = self._build_nested_paths() _parquet.pyx in pyarrow._parquet.ParquetReader.open() error.pxi in pyarrow.lib.check_status() ArrowIOError: Invalid parquet file. Corrupt footer.
I was able to read and write parquet file earlier (about a few days ago) and how its stopped working
**Environment**: Linux x86
anaconda python 3.6
pyarrow version 0.9.0
**Reporter**: [Alok](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alokgogate)
**Note**: *This issue was originally created as [PARQUET-1343](https://issues.apache.org/jira/browse/PARQUET-1343). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
Reproduisez le rapport sur Linux x86 avec Anaconda Python 3.6 et pyarrow 0.9.0 en lisant un fichier Parquet créé à partir d’un CSV, puis examinez l’ArrowIOError signalé concernant un footer corrompu. L’issue ne fournit aucun fichier du dépôt ni aucun test ; déterminez si la sortie de la conversion ou le reader est responsable avant de définir un fix et un test de régression.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- data-engineering
- Type d'issue
- Bug
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 25/100