apache / apache/iceberg-python
Support data files compaction
- Lingua principale
- Python
- Stelle
- 1.1k
- Fork
- 581
- Merge medio
- 1g 17h
- PR unite (30g)
- 78
Descrizione
Introduce an API to compact data files. The first version of the API will do the following:
- take a predicate expression as input parameter to find data files matching the filter that will be re-written
- group data files by partitions and rewrite them using the same bin-packing constraints of the writer
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Inizia leggendo le API esistenti di data-file e writer di PyIceberg per capire come sono rappresentati il filtraggio tramite predicati, il raggruppamento per partizione e i vincoli di bin-packing. Segui il percorso del writer e i test pertinenti prima di decidere dove collocare l’API di compaction. Il lavoro è completo quando i chiamanti possono fornire un predicato, i file corrispondenti vengono raggruppati per partizione e i file riscritti usano i vincoli di bin-packing esistenti del writer.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- data-engineering, databases
- Tipo di issue
- Funzionalità
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Tranquilla
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 48/100