apache / apache/parquet-java

Add Index support in the read path

Ouverte
#2,484 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Component: Parquet Priority: Major Type: task
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

The scope of this Jira is to add support for reading indexes from a Parquet file.

The changes will involve de-serializing indexes and adding API to return them.

To test the implementation, we can get Parquet files with indexes generated via Impala or parquet-mr and see that the parquet-cpp tools can print them.

**Reporter**: [Deepak Majeti](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=mdeepak) / @majetideepak
**Assignee**: [Deepak Majeti](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=mdeepak) / @majetideepak

**Note**: *This issue was originally created as [PARQUET-1848](https://issues.apache.org/jira/browse/PARQUET-1848). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez par localiser le chemin de lecture des métadonnées Parquet et la surface de l’API où les index désérialisés seraient renvoyés. Utilisez des fichiers Parquet avec des index générés via Impala ou parquet-mr, puis vérifiez que les outils parquet-cpp peuvent les afficher.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java
Domaine
data-engineering
Type d'issue
Fonctionnalité
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.