apache / apache/arrow

[C++][Parquet] A 175M DataFrame saved to parquet requires 1G of memory to be read

Offen
#38,245 16 Kommentare 1 Reaktion 0 zugewiesene Personen Auf GitHub ansehen
Component: Python Type: bug
Vorherrschende Sprache
C++
Sterne
17.1k
Forks
4.3k
Ø Merge
3 T. 23 Std.
Gemergte PRs (30 T.)
101

Beschreibung

### Describe the bug, including details regarding any error messages, version, and platform.

```python
import memray
import pyarrow.parquet
import pandas as pd

myfile_path = "history_files.parquet"

with memray.Tracker("corr.bin", native_traces=True):
# myfile = pd.read_parquet(myfile_path)
myfile = pyarrow.parquet.read_table(myfile_path, use_threads=False)
```

This reports a peak of 1GiB. Is that expected?

[myfile.zip](https://github.com/apache/arrow/files/12882729/myfile.zip)
[flamegraph.zip](https://github.com/apache/arrow/files/12882735/flamegraph.zip)

### Component(s)

Python

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Führen Sie zunächst den bereitgestellten Python-Reproducer mit history_files.parquet unter memray aus und untersuchen Sie anschließend die angehängten Ausgaben flamegraph.zip und corr.bin, um festzustellen, wo der Spitzenverbrauch an Speicher zugewiesen wird. Vergleichen Sie den Spitzenwert von 1 GiB mit der DataFrame-Größe von 175M und bestimmen Sie, ob dieses Verhalten erwartungsgemäß ist; abgeschlossen bedeutet eine durch Belege gestützte Erklärung oder ein eindeutig lokalisierter Speicherfehler.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
cpp, python
Bereich
data-engineering, performance
Issue-Typ
Bug
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.