Add support for Parquet Input Stream optimisations.
- Lingua principale
- Java
- Stelle
- 3.1k
- Fork
- 1.6k
- Merge medio
- 3g 12h
- PR unite (30g)
- 33
Descrizione
This issue tracks adding of a new module [parquet-io] with the goal of adding IO optimisations to the parquet-java repository.
The goal is to have a single place where the following optimisations can be implemented:
* Vectored Reads
* Reading the tail of a file in one request rather than multiple small requests (Avoid the parquet footer dance, multiple requests for the pageIndex)
* Small Parquet files are read in a single request
* Sequential prefetching
[Parquet Java Input Stream Optimisations](https://docs.google.com/document/d/1Xdlh23tmCs-KvzHhY2RuwFYmc3xntUKcmwb8yxEl78Y/edit?usp=sharing): Doc explains the features this will implement.
[Analytics Accelerator for S3](https://docs.google.com/document/d/13shy0RWotwfWC_qQksb95PXdi-vSUCKQyDzjoExQEN0/edit?tab=t.0#heading=h.3lc3p7s26rnw): Doc explains IO optimisations made in the analytics accelerator library.
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Inizia leggendo il documento «Parquet Java Input Stream Optimisations» e il documento «Analytics Accelerator for S3» collegati nell’issue. Definisci quindi l’ambito del modulo parquet-io proposto incentrandolo sulle letture vettoriali, sulle letture della coda e dei file di piccole dimensioni, sull’accesso all’indice delle pagine e sul prefetching sequenziale. Il lavoro sarà considerato completato quando sarà disponibile un piano di implementazione concordato e sarà fornito il supporto per le ottimizzazioni elencate.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- java
- Ambito
- data-engineering, performance
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Tranquilla
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 35/100