apache / apache/arrow-java

[java] cannot read datasets with many columns

Abierto
#199 1 comentario 0 reacciones 0 asignados Ver en GitHub
Type: bug
Lenguaje dominante
Java
Estrellas
94
Forks
152
Merge medio
3 d 16 h
PR fusionados (30 d)
11

Descripción

### Describe the bug, including details regarding any error messages, version, and platform.

Dataset API gets stuck if one tries to read many columns (100k+) from a parquet or arrow file. The API works if the amount of columns is narrowed via projection.

**Reproduction:**

Use the code from the [example](https://arrow.apache.org/cookbook/java/dataset.html#constructing-datasets) and try to read a file with 100k columns. No batch will be loaded even if the batch size is 1.

version: arrow-dataset 11.0

### Component(s)

Java

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza con la Java Dataset API y el ejemplo enlazado de construcción de datasets, reproduciendo el bloqueo con un archivo parquet o Arrow que contenga 100k+ columnas y un tamaño de batch de 1. Traza la ruta de lectura mientras la comparas con una proyección reducida; el trabajo estará terminado cuando los batches se carguen sin quedarse atascados en el caso reportado de un dataset ancho.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
java
Área
data
Tipo de issue
Error
Dificultad
4/5
Tiempo estimado
3-5 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
42/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.