apache / apache/parquet-java

Adding Bloom filter to small Parquet file bloats in size X1700

オープン
#2,667 コメント 4 件 リアクション 0 件 担当者 0 名 GitHub で見る
Component: CLI Component: Java Component: Parquet Priority: Critical Type: bug
主要言語
Java
スター
3.1k
フォーク
1.6k
平均マージ
3日 12時間
マージ済み PR(30日)
33

説明

Converting a small, 14 rows/1 string column csv file to Parquet without bloom filter yields a 600B file, adding '.withBloomFilterEnabled(true)' to ParquetWriter then yields a 1049197B file.

It isn't clear what the extra space is used by.

Attached csv and bloated Parquet files.

**Reporter**: [Ze'ev Maor](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=WiredWolf)
#### Original Issue Attachments:
- [data_index_bloom.parquet](https://issues.apache.org/jira/secure/attachment/13039997/data_index_bloom.parquet)
- [data.csv](https://issues.apache.org/jira/secure/attachment/13039998/data.csv)

**Note**: *This issue was originally created as [PARQUET-2122](https://issues.apache.org/jira/browse/PARQUET-2122). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

調査の方向性

添付された data.csv と data_index_bloom.parquet から始め、次に issue で説明されている変換を .withBloomFilterEnabled(true) を付けた場合と付けない場合で再現します。追加の領域がどこに割り当てられているかを調査し、この小さな入力に対する 600 B から 1,049,197 B への説明のつかない増加を回避することを完了の定義とします。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
java
領域
data
issue の種類
バグ
難易度
4/5
見積もり時間
3〜5日
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
25/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。