Take advantage of dictionary pages when performing rowgroup filters in the filter2 API
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 3 d 12 h
- PR fusionados (30 d)
- 33
Descripción
We currently only filter row groups via the min / max value in the row group.
We should additionally inspect the dictionary of unique values in a row group (if it has one) – this could dramatically increase our ability to drop entire rowgroups.
**Reporter**: [Alex Levenson](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alexlevenson) / @isnotinvain
**Note**: *This issue was originally created as [PARQUET-40](https://issues.apache.org/jira/browse/PARQUET-40). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Empieza rastreando la ruta existente de filtrado de grupos de filas de la API filter2, que actualmente utiliza valores min/max. Después, inspecciona cómo se representan los diccionarios de grupos de filas y los valores únicos, y determina cómo pueden contribuir a la eliminación de grupos de filas. Se considera terminado cuando los filtros pueden utilizar los datos de diccionario disponibles además de los metadatos min/max, con cobertura para los casos relevantes.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- java
- Área
- data
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Bastante claro
- Aptitud para principiantes
- 35/100