apache / apache/parquet-java

Adding Bloom filter to small Parquet file bloats in size X1700

Aperta
#2,667 4 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Component: CLI Component: Java Component: Parquet Priority: Critical Type: bug
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

Converting a small, 14 rows/1 string column csv file to Parquet without bloom filter yields a 600B file, adding '.withBloomFilterEnabled(true)' to ParquetWriter then yields a 1049197B file.

It isn't clear what the extra space is used by.

Attached csv and bloated Parquet files.

**Reporter**: [Ze'ev Maor](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=WiredWolf)
#### Original Issue Attachments:
- [data_index_bloom.parquet](https://issues.apache.org/jira/secure/attachment/13039997/data_index_bloom.parquet)
- [data.csv](https://issues.apache.org/jira/secure/attachment/13039998/data.csv)

**Note**: *This issue was originally created as [PARQUET-2122](https://issues.apache.org/jira/browse/PARQUET-2122). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia con i file allegati data.csv e data_index_bloom.parquet, quindi riproduci la conversione descritta nell’issue con e senza .withBloomFilterEnabled(true). Esamina dove viene allocato lo spazio aggiuntivo e definisci il completamento come l’evitare l’espansione inspiegata da 600 B a 1.049.197 B per questo piccolo input.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.