apache / apache/parquet-java

Take advantage of dictionary pages when performing rowgroup filters in the filter2 API

Đang mở
#1,467 0 bình luận 0 reaction 0 người được giao Xem trên GitHub
Component: Java Component: Parquet Priority: Major Type: enhancement
Ngôn ngữ chính
Java
Star
3.1k
Fork
1.6k
Merge trung bình
3 ngày 12 giờ
Pull request đã merge (30 ngày)
33

Mô tả

We currently only filter row groups via the min / max value in the row group.
We should additionally inspect the dictionary of unique values in a row group (if it has one) – this could dramatically increase our ability to drop entire rowgroups.

**Reporter**: [Alex Levenson](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alexlevenson) / @isnotinvain

**Note**: *This issue was originally created as [PARQUET-40](https://issues.apache.org/jira/browse/PARQUET-40). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Hướng nghiên cứu

Bắt đầu bằng cách lần theo đường đi hiện có của việc lọc nhóm hàng trong API filter2, hiện đang sử dụng các giá trị min/max. Sau đó, kiểm tra cách các từ điển nhóm hàng và các giá trị duy nhất được biểu diễn, đồng thời xác định cách chúng có thể hỗ trợ việc loại bỏ nhóm hàng. Công việc được xem là hoàn tất khi các bộ lọc có thể sử dụng dữ liệu từ điển hiện có ngoài siêu dữ liệu min/max, với độ bao phủ cho các trường hợp liên quan.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Đánh giá

Công nghệ
java
Lĩnh vực
data
Loại issue
Tính năng
Độ khó
4/5
Thời gian dự kiến
3-5 ngày
Mức độ hoạt động
Đình trệ
Độ rõ ràng
Khá rõ ràng
Mức phù hợp với người mới
35/100

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.