apache / apache/parquet-java

ParquetRecordReader support building ParquetFileReader using incoming Footer

Offen
#2,564 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Parquet Priority: Major Type: enhancement
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

SPARK-33449 discusses adding file meta cache mechanism for Spark SQL to reduce data reading and speed up query.

For the scenarios that need to use ParquetRecordReader, we hope to add an interface to support passing an existing footer to ParquetRecordReader and use this instance to build ParquetFileReader.

**Reporter**: [Yang Jie](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=LuciferYang) / @LuciferYang

**Note**: *This issue was originally created as [PARQUET-1965](https://issues.apache.org/jira/browse/PARQUET-1965). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginne damit, ParquetRecordReader und den Code zu lokalisieren, der ParquetFileReader erstellt, und untersuche anschließend die vorhandenen Reader-Tests und Verwendungen. Implementiere die Unterstützung für die Übergabe eines vorhandenen Footers und überprüfe, dass der Reader ihn beim Erstellen von ParquetFileReader verwendet, ohne den aktuellen Pfad für Aufrufer zu ändern, die keinen bereitstellen.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
45/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.