apache / apache/arrow

[C++][Parquet] A 175M DataFrame saved to parquet requires 1G of memory to be read

Aperta
#38,245 16 commenti 1 reazione 0 assegnatari Vedi su GitHub
Component: Python Type: bug
Lingua principale
C++
Stelle
17.1k
Fork
4.3k
Merge medio
3g 23h
PR unite (30g)
101

Descrizione

### Describe the bug, including details regarding any error messages, version, and platform.

```python
import memray
import pyarrow.parquet
import pandas as pd

myfile_path = "history_files.parquet"

with memray.Tracker("corr.bin", native_traces=True):
# myfile = pd.read_parquet(myfile_path)
myfile = pyarrow.parquet.read_table(myfile_path, use_threads=False)
```

This reports a peak of 1GiB. Is that expected?

[myfile.zip](https://github.com/apache/arrow/files/12882729/myfile.zip)
[flamegraph.zip](https://github.com/apache/arrow/files/12882735/flamegraph.zip)

### Component(s)

Python

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia eseguendo il riproduttore Python fornito con history_files.parquet sotto memray, quindi ispeziona gli output allegati flamegraph.zip e corr.bin per identificare dove viene allocata la memoria di picco. Confronta il picco di 1 GiB con la dimensione di 175M del DataFrame e determina se il comportamento è previsto; il lavoro è completato quando è disponibile una spiegazione supportata da evidenze o un problema di memoria chiaramente localizzato.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
cpp, python
Ambito
data-engineering, performance
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.