apache / apache/iceberg-python

Support data files compaction

Offen
#1,092 13 Kommentare 33 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Python
Sterne
1.1k
Forks
581
Ø Merge
1 T. 17 Std.
Gemergte PRs (30 T.)
78

Beschreibung

Introduce an API to compact data files. The first version of the API will do the following:
- take a predicate expression as input parameter to find data files matching the filter that will be re-written
- group data files by partitions and rewrite them using the same bin-packing constraints of the writer

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Lies zunächst die vorhandenen Data-File- und Writer-APIs von PyIceberg, um zu verstehen, wie Predicate-Filtering, Partition-Gruppierung und Bin-Packing-Constraints dargestellt werden. Verfolge den Writer-Pfad und die relevanten Tests, bevor du entscheidest, wo die Compaction-API hingehört. Erledigt ist es, wenn Aufrufer ein Predicate angeben können, passende Dateien nach Partition gruppiert werden und neu geschriebene Dateien die vorhandenen Bin-Packing-Constraints des Writers verwenden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python
Bereich
data-engineering, databases
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Ruhig
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
48/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.