Unable to read a parquet file
- Vorherrschende Sprache
- Java
- Sterne
- 3.1k
- Forks
- 1.6k
- Ø Merge
- 3 T. 12 Std.
- Gemergte PRs (30 T.)
- 33
Beschreibung
I am unable to read a parquet file that was made after converting a csv to a parquet file using pyarrow. Following is the error
ArrowIOError Traceback (most recent call last) in () ~/anaconda3/lib/python3.6/site-packages/pyarrow/parquet.py in read_table(source, columns, nthreads, metadata, use_pandas_metadata) 937 return fs.read_parquet(source, columns=columns, metadata=metadata) 938 --> 939 pf = ParquetFile(source, metadata=metadata) 940 return pf.read(columns=columns, nthreads=nthreads, 941 use_pandas_metadata=use_pandas_metadata) ~/anaconda3/lib/python3.6/site-packages/pyarrow/parquet.py in __init__(self, source, metadata, common_metadata) 62 self.reader = ParquetReader() 63 source = _ensure_file(source) ---> 64 self.reader.open(source, metadata=metadata) 65 self.common_metadata = common_metadata 66 self._nested_paths_by_prefix = self._build_nested_paths() _parquet.pyx in pyarrow._parquet.ParquetReader.open() error.pxi in pyarrow.lib.check_status() ArrowIOError: Invalid parquet file. Corrupt footer.
I was able to read and write parquet file earlier (about a few days ago) and how its stopped working
**Environment**: Linux x86
anaconda python 3.6
pyarrow version 0.9.0
**Reporter**: [Alok](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alokgogate)
**Note**: *This issue was originally created as [PARQUET-1343](https://issues.apache.org/jira/browse/PARQUET-1343). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Rechercherichtung
Reproduziere den Bericht unter Linux x86 mit Anaconda Python 3.6 und pyarrow 0.9.0, indem du eine aus CSV erstellte Parquet-Datei liest, und untersuche anschließend den gemeldeten ArrowIOError bezüglich eines beschädigten Footers. Das Issue stellt weder eine Repository-Datei noch einen Test bereit; ermittle, ob die Konvertierungsausgabe oder der Reader dafür verantwortlich ist, bevor du einen Fix und einen Regressionstest definierst.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- data-engineering
- Issue-Typ
- Bug
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 25/100