apache / apache/parquet-java

Vectorized Read

Offen
#1,463 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Parquet Priority: Major Type: enhancement
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

The goal is to implement more CPU efficient vectorized readers for columns.
Vectorized execution engines can use them and skip assembly altogether.

**Reporter**: [Julien Le Dem](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=julienledem) / @julienledem

**Note**: *This issue was originally created as [PARQUET-424](https://issues.apache.org/jira/browse/PARQUET-424). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

In diesem Issue werden keine Dateien, Tests oder Einstiegspunkte genannt. Beginne damit, die Implementierungen der Spaltenleser im Repository zu untersuchen, und ermittle, welche Reader-APIs vektorisierte Ausführungs-Engines verwenden würden. Das Issue definiert weder einen spezifischen Implementierungsumfang noch überprüfbare Abschlusskriterien; daher müssen diese vor Beginn der Arbeit geklärt werden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.