apache / apache/parquet-java

ParquetRecordReader support building ParquetFileReader using incoming Footer

Abierto
#2,564 0 comentarios 0 reacciones 0 asignados Ver en GitHub
Component: Parquet Priority: Major Type: enhancement
Lenguaje dominante
Java
Estrellas
3.1k
Forks
1.6k
Merge medio
3 d 12 h
PR fusionados (30 d)
33

Descripción

SPARK-33449 discusses adding file meta cache mechanism for Spark SQL to reduce data reading and speed up query.

For the scenarios that need to use ParquetRecordReader, we hope to add an interface to support passing an existing footer to ParquetRecordReader and use this instance to build ParquetFileReader.

**Reporter**: [Yang Jie](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=LuciferYang) / @LuciferYang

**Note**: *This issue was originally created as [PARQUET-1965](https://issues.apache.org/jira/browse/PARQUET-1965). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Línea de trabajo

Comienza localizando ParquetRecordReader y el código que construye ParquetFileReader; después, inspecciona las pruebas y los usos existentes del reader. Implementa la compatibilidad para proporcionar un footer existente y verifica que el reader lo use al construir ParquetFileReader, sin cambiar el flujo actual para los callers que no proporcionen uno.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
java
Área
data-engineering
Tipo de issue
Nueva funcionalidad
Dificultad
3/5
Tiempo estimado
1-2 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
45/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.