apache / apache/iceberg-python

Support data files compaction

Aperta
#1,092 13 commenti 33 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
1.1k
Fork
581
Merge medio
1g 17h
PR unite (30g)
78

Descrizione

Introduce an API to compact data files. The first version of the API will do the following:
- take a predicate expression as input parameter to find data files matching the filter that will be re-written
- group data files by partitions and rewrite them using the same bin-packing constraints of the writer

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia leggendo le API esistenti di data-file e writer di PyIceberg per capire come sono rappresentati il filtraggio tramite predicati, il raggruppamento per partizione e i vincoli di bin-packing. Segui il percorso del writer e i test pertinenti prima di decidere dove collocare l’API di compaction. Il lavoro è completo quando i chiamanti possono fornire un predicato, i file corrispondenti vengono raggruppati per partizione e i file riscritti usano i vincoli di bin-packing esistenti del writer.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
data-engineering, databases
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Tranquilla
Chiarezza
Abbastanza chiara
Idoneità per principianti
48/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.