Add new APIs for nested predicate pushdown
- Langage dominant
- Java
- Étoiles
- 3.1k
- Forks
- 1.6k
- Merge moyen
- 3 j 12 h
- PR mergées (30 j)
- 33
Description
Currently, Parquet's **org.apache.parquet.filter2.predicate.FilterApi** is using **dot** to split the column name into multi-parts of nested fields. The drawback is that this causes issues when the field name contains **dot**.
The new APIs that will be added will take array of string directly for multi-parts of nested fields, so no confusion as using **dot** as a separator.
See https://github.com/apache/spark/pull/27728 and [SPARK-17636] for details.
**Reporter**: [DB Tsai](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dbtsai)
**Note**: *This issue was originally created as [PARQUET-1809](https://issues.apache.org/jira/browse/PARQUET-1809). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
Commencez par org.apache.parquet.filter2.predicate.FilterApi et examinez comment les noms de colonnes contenant des points sont actuellement séparés pour les champs imbriqués. Consultez la pull request Spark liée et SPARK-17636 pour déterminer la forme prévue de l’API. La tâche est terminée lorsque les APIs basées sur des tableaux prennent en charge les noms de champs imbriqués sans traiter les points à l’intérieur d’un nom de champ comme des séparateurs.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java
- Domaine
- api, backend-api-design
- Type d'issue
- Fonctionnalité
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 42/100