apache / apache/parquet-java

Add new APIs for nested predicate pushdown

Abierto
#2,467 5 comentarios 0 reacciones 0 asignados Ver en GitHub
Component: Java Component: Parquet Priority: Major Type: enhancement
Lenguaje dominante
Java
Estrellas
3.1k
Forks
1.6k
Merge medio
3 d 12 h
PR fusionados (30 d)
33

Descripción

Currently, Parquet's **org.apache.parquet.filter2.predicate.FilterApi** is using **dot** to split the column name into multi-parts of nested fields. The drawback is that this causes issues when the field name contains **dot**.

The new APIs that will be added will take array of string directly for multi-parts of nested fields, so no confusion as using **dot** as a separator.

See https://github.com/apache/spark/pull/27728 and [SPARK-17636] for details.

**Reporter**: [DB Tsai](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dbtsai)

**Note**: *This issue was originally created as [PARQUET-1809](https://issues.apache.org/jira/browse/PARQUET-1809). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Línea de trabajo

Comienza con org.apache.parquet.filter2.predicate.FilterApi y revisa cómo se separan actualmente los nombres de columna con puntos para los campos anidados. Comprueba el pull request de Spark enlazado y SPARK-17636 para conocer la forma prevista de la API. Se considera completado cuando las APIs basadas en arrays admiten nombres de campos anidados sin tratar los puntos dentro de un nombre de campo como separadores.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
java
Área
api, backend-api-design
Tipo de issue
Nueva funcionalidad
Dificultad
4/5
Tiempo estimado
3-5 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
42/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.