[java] cannot read datasets with many columns
- Linguagem predominante
- Java
- Estrelas
- 94
- Forks
- 152
- Merge médio
- 3d 16h
- PRs com merge (30d)
- 11
Descrição
### Describe the bug, including details regarding any error messages, version, and platform.
Dataset API gets stuck if one tries to read many columns (100k+) from a parquet or arrow file. The API works if the amount of columns is narrowed via projection.
**Reproduction:**
Use the code from the [example](https://arrow.apache.org/cookbook/java/dataset.html#constructing-datasets) and try to read a file with 100k columns. No batch will be loaded even if the batch size is 1.
version: arrow-dataset 11.0
### Component(s)
Java
Guia de contribuição
Direção de pesquisa
Comece com a Java Dataset API e o exemplo vinculado de construção de dataset, reproduzindo o travamento com um arquivo parquet ou Arrow contendo 100k+ colunas e um tamanho de batch de 1. Rastreie o caminho de leitura enquanto o compara com uma projeção reduzida; o trabalho estará concluído quando os batches forem carregados sem travar no caso relatado de um dataset amplo.
Escrita pelo modelo de indexação a partir do texto da issue.
Avaliação
- Stack de tecnologia
- java
- Domínio
- data
- Tipo de issue
- Bug
- Dificuldade
- 4/5
- Tempo estimado
- 3-5 dias
- Status de atividade
- Estagnada
- Clareza
- Razoavelmente clara
- Facilidade para iniciantes
- 42/100