apache / apache/parquet-java

Add Index support in the read path

Aperta
#2,484 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Component: Parquet Priority: Major Type: task
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

The scope of this Jira is to add support for reading indexes from a Parquet file.

The changes will involve de-serializing indexes and adding API to return them.

To test the implementation, we can get Parquet files with indexes generated via Impala or parquet-mr and see that the parquet-cpp tools can print them.

**Reporter**: [Deepak Majeti](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=mdeepak) / @majetideepak
**Assignee**: [Deepak Majeti](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=mdeepak) / @majetideepak

**Note**: *This issue was originally created as [PARQUET-1848](https://issues.apache.org/jira/browse/PARQUET-1848). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia individuando il percorso di lettura dei metadati Parquet e la superficie dell'API in cui verrebbero restituiti gli indici deserializzati. Usa file Parquet con indici generati tramite Impala o parquet-mr, quindi verifica che gli strumenti parquet-cpp possano stamparli.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data-engineering
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.