[java] cannot read datasets with many columns
- Lingua principale
- Java
- Stelle
- 94
- Fork
- 152
- Merge medio
- 3g 16h
- PR unite (30g)
- 11
Descrizione
### Describe the bug, including details regarding any error messages, version, and platform.
Dataset API gets stuck if one tries to read many columns (100k+) from a parquet or arrow file. The API works if the amount of columns is narrowed via projection.
**Reproduction:**
Use the code from the [example](https://arrow.apache.org/cookbook/java/dataset.html#constructing-datasets) and try to read a file with 100k columns. No batch will be loaded even if the batch size is 1.
version: arrow-dataset 11.0
### Component(s)
Java
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia con la Java Dataset API e l’esempio collegato di costruzione del dataset, riproducendo il blocco con un file parquet o Arrow contenente 100k+ colonne e una dimensione del batch pari a 1. Traccia il percorso di lettura confrontandolo con una proiezione ristretta; il lavoro è completato quando i batch vengono caricati senza bloccarsi per il caso segnalato di un dataset largo.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- java
- Ambito
- data
- Tipo di issue
- Bug
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 42/100