[java] cannot read datasets with many columns
- Vorherrschende Sprache
- Java
- Sterne
- 94
- Forks
- 152
- Ø Merge
- 3 T. 16 Std.
- Gemergte PRs (30 T.)
- 11
Beschreibung
### Describe the bug, including details regarding any error messages, version, and platform.
Dataset API gets stuck if one tries to read many columns (100k+) from a parquet or arrow file. The API works if the amount of columns is narrowed via projection.
**Reproduction:**
Use the code from the [example](https://arrow.apache.org/cookbook/java/dataset.html#constructing-datasets) and try to read a file with 100k columns. No batch will be loaded even if the batch size is 1.
version: arrow-dataset 11.0
### Component(s)
Java
Beitragsleitfaden
Rechercherichtung
Beginne mit der Java Dataset API und dem verlinkten Beispiel zur Dataset-Erstellung, reproduziere den Hänger mit einer parquet- oder Arrow-Datei mit 100k+ Spalten und einer Batchgröße von 1. Verfolge den Leseweg und vergleiche ihn dabei mit einer eingeschränkten Projektion; abgeschlossen ist die Arbeit, wenn Batches für den gemeldeten Fall eines breiten Datasets geladen werden, ohne stecken zu bleiben.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- java
- Bereich
- data
- Issue-Typ
- Bug
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 42/100