apache / apache/parquet-java

Reuse hadoop file status and footer in ParquetRecordReader

Aperta
#3,697 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Type: enhancement
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

### Describe the enhancement requested

This is actually [PARQUET-2415](https://issues.apache.org/jira/browse/PARQUET-2415)
_Reuse hadoop file status and footer in ParquetRecordReader_ moved to a github issue.

That has a stale pr #1242 by @wankunde; I've got claude to rebase it and update to junit5/assertj

### Component(s)

Core

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia individuando ParquetRecordReader nel modulo core ed esamina il PR #1242 obsoleto, menzionato come implementazione esistente. Esegui i test pertinenti del reader core e confrontane la copertura; il lavoro è completato quando il reader riutilizza lo stato del file e il footer di Hadoop senza regressioni.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
hadoop, java
Ambito
data-engineering
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.