Question on pig loader read parquet file
- Ngôn ngữ chính
- Java
- Star
- 3.1k
- Fork
- 1.6k
- Merge trung bình
- 3 ngày 12 giờ
- Pull request đã merge (30 ngày)
- 33
Mô tả
When I use spark save parquet file, schema like this
```
optional group attref (LIST) {
repeated group list {
optional group element {
optional binary nid (UTF8);
optional binary nss (UTF8);
}
}
}
```
And then use parquet-pig-bundle to read this file, the read function can work, but when i need to access "nid" it have some problem
If I read other file save by pig-storer, and need nid list, pig command is:
```
B = foreach A generate value.addr.clientIp_bag.clientIp, value.guid , value.attref.nid;
```
but read spark save version I need use this:
```
B = foreach M generate value.addr.clientIp, value.guid , flatten(value.attref);
C = foreach B generate clientIp, guid, attref::element.nid;
```
and this command will flatten column
My question is pig loader have some problem when loading parquet file(save by spark)
**Reporter**: [abel_ke](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=abel_ke)
**Note**: *This issue was originally created as [PARQUET-1172](https://issues.apache.org/jira/browse/PARQUET-1172). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Báo cáo đề cập đến parquet-pig-bundle và đối chiếu một schema LIST được Spark ghi với đầu ra của Pig-storer; hãy bắt đầu bằng cách tái hiện cả hai lần đọc và theo dõi cách loader cung cấp attref và nid. Hoàn thành khi tệp do Spark tạo ra cho phép truy cập nid như dự kiến mà không flattening ngoài mong muốn, đồng thời có coverage cho schema và các lệnh đã được báo cáo.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Lĩnh vực
- data-engineering
- Loại issue
- Lỗi
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Cần làm rõ
- Mức phù hợp với người mới
- 25/100