Unable to read a parquet file
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 3 d 12 h
- PR fusionados (30 d)
- 33
Descripción
I am unable to read a parquet file that was made after converting a csv to a parquet file using pyarrow. Following is the error
ArrowIOError Traceback (most recent call last) in () ~/anaconda3/lib/python3.6/site-packages/pyarrow/parquet.py in read_table(source, columns, nthreads, metadata, use_pandas_metadata) 937 return fs.read_parquet(source, columns=columns, metadata=metadata) 938 --> 939 pf = ParquetFile(source, metadata=metadata) 940 return pf.read(columns=columns, nthreads=nthreads, 941 use_pandas_metadata=use_pandas_metadata) ~/anaconda3/lib/python3.6/site-packages/pyarrow/parquet.py in __init__(self, source, metadata, common_metadata) 62 self.reader = ParquetReader() 63 source = _ensure_file(source) ---> 64 self.reader.open(source, metadata=metadata) 65 self.common_metadata = common_metadata 66 self._nested_paths_by_prefix = self._build_nested_paths() _parquet.pyx in pyarrow._parquet.ParquetReader.open() error.pxi in pyarrow.lib.check_status() ArrowIOError: Invalid parquet file. Corrupt footer.
I was able to read and write parquet file earlier (about a few days ago) and how its stopped working
**Environment**: Linux x86
anaconda python 3.6
pyarrow version 0.9.0
**Reporter**: [Alok](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alokgogate)
**Note**: *This issue was originally created as [PARQUET-1343](https://issues.apache.org/jira/browse/PARQUET-1343). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Reproduce el informe en Linux x86 con Anaconda Python 3.6 y pyarrow 0.9.0 leyendo un archivo Parquet creado a partir de CSV; después, inspecciona el ArrowIOError notificado sobre un footer corrupto. El issue no proporciona ningún archivo del repositorio ni ninguna prueba; determina si la salida de la conversión o el reader es responsable antes de definir un fix y una prueba de regresión.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- data-engineering
- Tipo de issue
- Error
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100