Add new APIs for nested predicate pushdown
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 3 d 12 h
- PR fusionados (30 d)
- 33
Descripción
Currently, Parquet's **org.apache.parquet.filter2.predicate.FilterApi** is using **dot** to split the column name into multi-parts of nested fields. The drawback is that this causes issues when the field name contains **dot**.
The new APIs that will be added will take array of string directly for multi-parts of nested fields, so no confusion as using **dot** as a separator.
See https://github.com/apache/spark/pull/27728 and [SPARK-17636] for details.
**Reporter**: [DB Tsai](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dbtsai)
**Note**: *This issue was originally created as [PARQUET-1809](https://issues.apache.org/jira/browse/PARQUET-1809). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Comienza con org.apache.parquet.filter2.predicate.FilterApi y revisa cómo se separan actualmente los nombres de columna con puntos para los campos anidados. Comprueba el pull request de Spark enlazado y SPARK-17636 para conocer la forma prevista de la API. Se considera completado cuando las APIs basadas en arrays admiten nombres de campos anidados sin tratar los puntos dentro de un nombre de campo como separadores.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- java
- Área
- api, backend-api-design
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Bastante claro
- Aptitud para principiantes
- 42/100