apache / apache/parquet-java

Add new APIs for nested predicate pushdown

Offen
#2,467 5 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Java Component: Parquet Priority: Major Type: enhancement
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

Currently, Parquet's **org.apache.parquet.filter2.predicate.FilterApi** is using **dot** to split the column name into multi-parts of nested fields. The drawback is that this causes issues when the field name contains **dot**.

The new APIs that will be added will take array of string directly for multi-parts of nested fields, so no confusion as using **dot** as a separator.

See https://github.com/apache/spark/pull/27728 and [SPARK-17636] for details.

**Reporter**: [DB Tsai](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dbtsai)

**Note**: *This issue was originally created as [PARQUET-1809](https://issues.apache.org/jira/browse/PARQUET-1809). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginne mit org.apache.parquet.filter2.predicate.FilterApi und überprüfe, wie Namen von Spalten mit Punkten derzeit für verschachtelte Felder aufgeteilt werden. Sieh dir den verlinkten Spark-Pull-Request und SPARK-17636 an, um die vorgesehene API-Form zu bestimmen. Erledigt ist die Aufgabe, wenn array-basierte APIs verschachtelte Feldnamen unterstützen, ohne Punkte innerhalb eines Feldnamens als Trennzeichen zu behandeln.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
api, backend-api-design
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
42/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.