apache / apache/datafusion

Add support for Range partitioning

Aperta
#3,628 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
enhancement
Lingua principale
Rust
Stelle
9.3k
Fork
2.4k
Merge medio
3g 11h
PR unite (30g)
360

Descrizione

**Is your feature request related to a problem or challenge? Please describe what you are trying to do.**
In order to support parallel sort (or distributed sort in Ballista) we need to implement range partitioning.

**Describe the solution you'd like**
We should support partitioning by range.
A range is a vector of buckets (for example `[0, 100, 200, 400, 600, 1000]`) combined with a expression.
The range vector might be given or computed/updated during query execution.

Each value belongs to partition i when the value is between the range values i and i + 1.

**Describe alternatives you've considered**

**Additional context**

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia individuando l’implementazione esistente del partizionamento e il percorso di ordinamento parallelo o distribuito in DataFusion. Esamina come sono rappresentate le espressioni di partizionamento e il numero di partizioni, quindi definisci il comportamento dei bucket per intervallo, inclusi i limiti calcolati o aggiornati a runtime. Il lavoro è completato quando i valori vengono assegnati alle partizioni per intervallo corrette e il comportamento è coperto dai test.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
rust
Ambito
data-engineering, distributed-systems
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
32/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.