[C++][Parquet] A 175M DataFrame saved to parquet requires 1G of memory to be read
- Lingua principale
- C++
- Stelle
- 17.1k
- Fork
- 4.3k
- Merge medio
- 3g 23h
- PR unite (30g)
- 101
Descrizione
### Describe the bug, including details regarding any error messages, version, and platform.
```python
import memray
import pyarrow.parquet
import pandas as pd
myfile_path = "history_files.parquet"
with memray.Tracker("corr.bin", native_traces=True):
# myfile = pd.read_parquet(myfile_path)
myfile = pyarrow.parquet.read_table(myfile_path, use_threads=False)
```
This reports a peak of 1GiB. Is that expected?
[myfile.zip](https://github.com/apache/arrow/files/12882729/myfile.zip)
[flamegraph.zip](https://github.com/apache/arrow/files/12882735/flamegraph.zip)
### Component(s)
Python
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia eseguendo il riproduttore Python fornito con history_files.parquet sotto memray, quindi ispeziona gli output allegati flamegraph.zip e corr.bin per identificare dove viene allocata la memoria di picco. Confronta il picco di 1 GiB con la dimensione di 175M del DataFrame e determina se il comportamento è previsto; il lavoro è completato quando è disponibile una spiegazione supportata da evidenze o un problema di memoria chiaramente localizzato.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- cpp, python
- Ambito
- data-engineering, performance
- Tipo di issue
- Bug
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 35/100