apache / apache/parquet-java

Concurrent read micro benchmarks

Aperta
#2,108 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Component: Java Component: Parquet Priority: Minor Type: enhancement
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

parquet-benchmarks only contain read and write benchmarks with a single thread.
I add concurrent Parquet file scans like typical data-parallel computing.

**Reporter**: [Takeshi Yoshimura](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=tyos)
#### PRs and other links:
- [PR440](https://github.com/apache/parquet-mr/pull/440)

**Note**: *This issue was originally created as [PARQUET-1174](https://issues.apache.org/jira/browse/PARQUET-1174). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia esaminando i benchmark esistenti di lettura e scrittura di parquet-benchmarks e PR440, collegato dall’issue. Il risultato richiesto consiste in microbenchmark concorrenti per la scansione di file Parquet che rappresentino il calcolo parallelo sui dati, anziché limitarsi a letture single-threaded.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data-engineering, performance
Tipo di issue
Funzionalità
Difficoltà
3/5
Tempo stimato
1-2 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.