[java] cannot read datasets with many columns
- Langage dominant
- Java
- Étoiles
- 94
- Forks
- 152
- Merge moyen
- 3 j 16 h
- PR mergées (30 j)
- 11
Description
### Describe the bug, including details regarding any error messages, version, and platform.
Dataset API gets stuck if one tries to read many columns (100k+) from a parquet or arrow file. The API works if the amount of columns is narrowed via projection.
**Reproduction:**
Use the code from the [example](https://arrow.apache.org/cookbook/java/dataset.html#constructing-datasets) and try to read a file with 100k columns. No batch will be loaded even if the batch size is 1.
version: arrow-dataset 11.0
### Component(s)
Java
Guide de contribution
Ouvrir le guide de contribution
Piste de recherche
Commencez par la Java Dataset API et l’exemple lié de construction de dataset, en reproduisant le blocage avec un fichier parquet ou Arrow contenant 100k+ colonnes et une batch size de 1. Suivez le chemin de lecture tout en le comparant à une projection réduite ; le travail est terminé lorsque les batches se chargent sans rester bloqués pour le cas signalé d’un dataset large.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java
- Domaine
- data
- Type d'issue
- Bug
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 42/100