apache / apache/parquet-java

Reuse hadoop file status and footer in ParquetRecordReader

Offen
#3,697 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Type: enhancement
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

### Describe the enhancement requested

This is actually [PARQUET-2415](https://issues.apache.org/jira/browse/PARQUET-2415)
_Reuse hadoop file status and footer in ParquetRecordReader_ moved to a github issue.

That has a stale pr #1242 by @wankunde; I've got claude to rebase it and update to junit5/assertj

### Component(s)

Core

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginne damit, ParquetRecordReader im core-Modul zu lokalisieren und den veralteten PR #1242 zu prüfen, der als bestehende Implementierung erwähnt wird. Führe die relevanten core reader tests aus und vergleiche deren Abdeckung; abgeschlossen ist die Aufgabe, wenn der Reader den Hadoop-Dateistatus und Footer ohne Regressionen wiederverwendet.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
hadoop, java
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.