apache / apache/parquet-java

Improve logic when to write column indexes

Ouverte
#2,228 2 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Component: Parquet Priority: Minor Type: enhancement
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

Currently, we always write column indexes. In case of the data is ordered (ASCENDING or DESCENDING) the filtering would highly benefit from column indexes. While, if the data is UNORDERED it is not obvious if ordering based on column indexes would make sense. For example if the data is random then the min/max values of the different pages might be close to each other so in most cases filtering based on these values would not drop any of the pages. In the other hand UNORDERED values does not mean that the values are random. It can happen that the values are clustered or semi-ordered. We shall discover these cases somehow before writing the column indexes and write only if the min/max values for the pages do not overlap too much.

Another simple case if we have only one page. In this case writing column indexes is useless. 

**Reporter**: [Gabor Szadovszky](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=gszadovszky) / @gszadovszky
**Assignee**: [Gabor Szadovszky](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=gszadovszky) / @gszadovszky
#### Related issues:
- [Column indexes](https://github.com/apache/parquet-java/issues/2123) (depends upon)
- [Benchmark filtering column-indexes](https://github.com/apache/parquet-java/issues/2235) (depends upon)

**Note**: *This issue was originally created as [PARQUET-1415](https://issues.apache.org/jira/browse/PARQUET-1415). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez par retracer le chemin d’écriture de column-index et la manière dont il gère les données ordonnées et non ordonnées. Comparez le comportement pour les données sur une seule page et en cas de chevauchement des valeurs min/max des pages ; le travail est considéré comme terminé lorsque les indexes sont omis lorsqu’ils ne peuvent pas améliorer le filtrage, avec une couverture des cas ordonnés, non ordonnés, clusterisés et sur une seule page.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java
Domaine
data-engineering, performance
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.