apache / apache/parquet-java

ParquetRecordReader support building ParquetFileReader using incoming Footer

Aperta
#2,564 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Component: Parquet Priority: Major Type: enhancement
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

SPARK-33449 discusses adding file meta cache mechanism for Spark SQL to reduce data reading and speed up query.

For the scenarios that need to use ParquetRecordReader, we hope to add an interface to support passing an existing footer to ParquetRecordReader and use this instance to build ParquetFileReader.

**Reporter**: [Yang Jie](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=LuciferYang) / @LuciferYang

**Note**: *This issue was originally created as [PARQUET-1965](https://issues.apache.org/jira/browse/PARQUET-1965). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia individuando ParquetRecordReader e il codice che costruisce ParquetFileReader, quindi esamina i test e gli utilizzi esistenti del reader. Implementa il supporto per fornire un footer esistente e verifica che il reader lo utilizzi durante la costruzione di ParquetFileReader, senza modificare il percorso attuale per i callers che non ne forniscono uno.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data-engineering
Tipo di issue
Funzionalità
Difficoltà
3/5
Tempo stimato
1-2 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
45/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.