[C++][Parquet] A 175M DataFrame saved to parquet requires 1G of memory to be read
- Vorherrschende Sprache
- C++
- Sterne
- 17.1k
- Forks
- 4.3k
- Ø Merge
- 3 T. 23 Std.
- Gemergte PRs (30 T.)
- 101
Beschreibung
### Describe the bug, including details regarding any error messages, version, and platform.
```python
import memray
import pyarrow.parquet
import pandas as pd
myfile_path = "history_files.parquet"
with memray.Tracker("corr.bin", native_traces=True):
# myfile = pd.read_parquet(myfile_path)
myfile = pyarrow.parquet.read_table(myfile_path, use_threads=False)
```
This reports a peak of 1GiB. Is that expected?
[myfile.zip](https://github.com/apache/arrow/files/12882729/myfile.zip)
[flamegraph.zip](https://github.com/apache/arrow/files/12882735/flamegraph.zip)
### Component(s)
Python
Beitragsleitfaden
Rechercherichtung
Führen Sie zunächst den bereitgestellten Python-Reproducer mit history_files.parquet unter memray aus und untersuchen Sie anschließend die angehängten Ausgaben flamegraph.zip und corr.bin, um festzustellen, wo der Spitzenverbrauch an Speicher zugewiesen wird. Vergleichen Sie den Spitzenwert von 1 GiB mit der DataFrame-Größe von 175M und bestimmen Sie, ob dieses Verhalten erwartungsgemäß ist; abgeschlossen bedeutet eine durch Belege gestützte Erklärung oder ein eindeutig lokalisierter Speicherfehler.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- cpp, python
- Bereich
- data-engineering, performance
- Issue-Typ
- Bug
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 35/100