apache / apache/arrow-java

[java] cannot read datasets with many columns

Aperta
#199 1 commento 0 reazioni 0 assegnatari Vedi su GitHub
Type: bug
Lingua principale
Java
Stelle
94
Fork
152
Merge medio
3g 16h
PR unite (30g)
11

Descrizione

### Describe the bug, including details regarding any error messages, version, and platform.

Dataset API gets stuck if one tries to read many columns (100k+) from a parquet or arrow file. The API works if the amount of columns is narrowed via projection.

**Reproduction:**

Use the code from the [example](https://arrow.apache.org/cookbook/java/dataset.html#constructing-datasets) and try to read a file with 100k columns. No batch will be loaded even if the batch size is 1.

version: arrow-dataset 11.0

### Component(s)

Java

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia con la Java Dataset API e l’esempio collegato di costruzione del dataset, riproducendo il blocco con un file parquet o Arrow contenente 100k+ colonne e una dimensione del batch pari a 1. Traccia il percorso di lettura confrontandolo con una proiezione ristretta; il lavoro è completato quando i batch vengono caricati senza bloccarsi per il caso segnalato di un dataset largo.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
42/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.