apache / apache/parquet-java

Add new APIs for nested predicate pushdown

Ouverte
#2,467 5 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Component: Java Component: Parquet Priority: Major Type: enhancement
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

Currently, Parquet's **org.apache.parquet.filter2.predicate.FilterApi** is using **dot** to split the column name into multi-parts of nested fields. The drawback is that this causes issues when the field name contains **dot**.

The new APIs that will be added will take array of string directly for multi-parts of nested fields, so no confusion as using **dot** as a separator.

See https://github.com/apache/spark/pull/27728 and [SPARK-17636] for details.

**Reporter**: [DB Tsai](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dbtsai)

**Note**: *This issue was originally created as [PARQUET-1809](https://issues.apache.org/jira/browse/PARQUET-1809). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez par org.apache.parquet.filter2.predicate.FilterApi et examinez comment les noms de colonnes contenant des points sont actuellement séparés pour les champs imbriqués. Consultez la pull request Spark liée et SPARK-17636 pour déterminer la forme prévue de l’API. La tâche est terminée lorsque les APIs basées sur des tableaux prennent en charge les noms de champs imbriqués sans traiter les points à l’intérieur d’un nom de champ comme des séparateurs.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java
Domaine
api, backend-api-design
Type d'issue
Fonctionnalité
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
42/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.