apache / apache/parquet-java

Question on pig loader read parquet file

オープン
#2,106 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る
Component: Java Component: Parquet Component: Pig Priority: Major Type: bug
主要言語
Java
スター
3.1k
フォーク
1.6k
平均マージ
3日 12時間
マージ済み PR(30日)
33

説明

When I use spark save parquet file, schema like this

```

optional group attref (LIST) {
repeated group list {
optional group element {
optional binary nid (UTF8);
optional binary nss (UTF8);
}
}
}
```

And then use parquet-pig-bundle to read this file, the read function can work, but when i need to access "nid" it have some problem

If I read other file save by pig-storer, and need nid list, pig command is:
```

B = foreach A generate value.addr.clientIp_bag.clientIp, value.guid , value.attref.nid;
```
but read spark save version I need use this:
```

B = foreach M generate value.addr.clientIp, value.guid , flatten(value.attref);
C = foreach B generate clientIp, guid, attref::element.nid;
```
and this command will flatten column

My question is pig loader have some problem when loading parquet file(save by spark)

**Reporter**: [abel_ke](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=abel_ke)

**Note**: *This issue was originally created as [PARQUET-1172](https://issues.apache.org/jira/browse/PARQUET-1172). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

調査の方向性

レポートでは parquet-pig-bundle を取り上げ、Spark が書き込んだ LIST スキーマと Pig-storer の出力を対比しています。まず、両方の読み取りを再現し、loader が attref と nid をどのように公開するかを追跡してください。Spark が生成したファイルで、不要な flattening を行わずに意図した nid へのアクセスが可能になり、報告されたスキーマとコマンドを対象とするカバレッジがあれば完了です。

索引モデルが issue の本文から書いたものです。

評価

領域
data-engineering
issue の種類
バグ
難易度
4/5
見積もり時間
3〜5日
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
25/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。