apache / apache/parquet-java

Reduce memory pressure when reading footers

Đang mở
#1,385 1 bình luận 0 reaction 0 người được giao Xem trên GitHub
Component: Parquet Priority: Major Type: bug
Ngôn ngữ chính
Java
Star
3.1k
Fork
1.6k
Merge trung bình
3 ngày 12 giờ
Pull request đã merge (30 ngày)
33

Mô tả

I encountered OOMs reading metadata for a dataset with 500+ columns, many of them quite sparse.

We can reduce memory utilization significantly.

**Reporter**: [Dmitriy V. Ryaboy](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dvryaboy) / @dvryaboy

**Note**: *This issue was originally created as [PARQUET-11](https://issues.apache.org/jira/browse/PARQUET-11). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Hướng nghiên cứu

Bắt đầu bằng cách tái hiện tình trạng hết bộ nhớ khi đọc metadata của một dataset có hơn 500 cột sparse, sau đó lần theo đường dẫn đọc footer. Issue không nêu tên file hoặc test nào, vì vậy hãy xác định code metadata và footer liên quan trước khi quyết định thay đổi. Công việc được xem là hoàn tất khi mức sử dụng bộ nhớ giảm đáng kể mà không thay đổi kết quả đọc metadata.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Đánh giá

Công nghệ
java
Lĩnh vực
data-engineering, performance
Loại issue
Lỗi
Độ khó
4/5
Thời gian dự kiến
3-5 ngày
Mức độ hoạt động
Đình trệ
Độ rõ ràng
Cần làm rõ
Mức phù hợp với người mới
30/100

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.