apache / apache/parquet-java

Take advantage of dictionary pages when performing rowgroup filters in the filter2 API

Ouverte
#1,467 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Component: Java Component: Parquet Priority: Major Type: enhancement
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

We currently only filter row groups via the min / max value in the row group.
We should additionally inspect the dictionary of unique values in a row group (if it has one) – this could dramatically increase our ability to drop entire rowgroups.

**Reporter**: [Alex Levenson](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=alexlevenson) / @isnotinvain

**Note**: *This issue was originally created as [PARQUET-40](https://issues.apache.org/jira/browse/PARQUET-40). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez par suivre le chemin existant du filtrage des groupes de lignes de l’API filter2, qui utilise actuellement des valeurs min/max. Examinez ensuite comment les dictionnaires de groupes de lignes et les valeurs uniques sont représentés, et déterminez comment ils peuvent contribuer à l’élimination des groupes de lignes. Le travail est considéré comme terminé lorsque les filtres peuvent utiliser les données de dictionnaire disponibles en plus des métadonnées min/max, avec une couverture des cas pertinents.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java
Domaine
data
Type d'issue
Fonctionnalité
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
35/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.