apache / apache/arrow-java

[Java] Read a Parquet file into a Table

Aperta
#95 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Java
Stelle
94
Fork
152
Merge medio
3g 16h
PR unite (30g)
11

Descrizione

### Describe the usage question you have. Please include as many useful details as possible.

In Java, what is the canonical way of reading the whole content of a Parquet file into a Table?

I can read the file, as suggested, in a streaming fashion with VectorSchemaRoot, but then I miss how to collate all the batches into a single table.

From what I have understood, the options I have are:

1. build a big VectorSchemaRoot using VectorSchemaRootAppender, then invoke the Table constructor passing the vsr
2. construct FieldVectors explicitly, then read the parquet rows one by one (filling the FieldVectors as I go), then invoke the Table constructor passing a List

I see the C++ implementation has a convenient FromRecordBatches method.

### Component(s)

Java

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia leggendo l’utilizzo Java di VectorSchemaRoot, VectorSchemaRootAppender e dei costruttori di Table, quindi confrontalo con l’implementazione C++ FromRecordBatches menzionata nell’issue. Il lavoro è completo quando il progetto dispone di un percorso canonico deciso e documentato per caricare un file Parquet completo in una Table, oppure di un’API Java equivalente con copertura.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
30/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.