apache / apache/parquet-java

Take advantage of dictionary pages when performing rowgroup filters in the filter2 API

Abierto
#1,467 0 comentarios 0 reacciones 0 asignados Ver en GitHub
Component: Java Component: Parquet Priority: Major Type: enhancement
Lenguaje dominante
Java
Estrellas
3.1k
Forks
1.6k
Merge medio
3 d 12 h
PR fusionados (30 d)
33

Descripción

We currently only filter row groups via the min / max value in the row group.
We should additionally inspect the dictionary of unique values in a row group (if it has one) – this could dramatically increase our ability to drop entire rowgroups.

**Reporter**: [Alex Levenson](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alexlevenson) / @isnotinvain

**Note**: *This issue was originally created as [PARQUET-40](https://issues.apache.org/jira/browse/PARQUET-40). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Línea de trabajo

Empieza rastreando la ruta existente de filtrado de grupos de filas de la API filter2, que actualmente utiliza valores min/max. Después, inspecciona cómo se representan los diccionarios de grupos de filas y los valores únicos, y determina cómo pueden contribuir a la eliminación de grupos de filas. Se considera terminado cuando los filtros pueden utilizar los datos de diccionario disponibles además de los metadatos min/max, con cobertura para los casos relevantes.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
java
Área
data
Tipo de issue
Nueva funcionalidad
Dificultad
4/5
Tiempo estimado
3-5 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
35/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.