apache / apache/parquet-java

Perform encoding before bloom filters write out

Offen
#2,278 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: C++ Component: Java Component: Parquet Priority: Minor Type: task
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

When entropy of bloom filter is low say nearly all 0 or all 1, we may want to consider to use encoding to save space.

**Reporter**: [Junjie Chen](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=junjie) / @chenjunjiedada

**Note**: *This issue was originally created as [PARQUET-1495](https://issues.apache.org/jira/browse/PARQUET-1495). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Das Issue nennt keine Dateien, Tests oder Einstiegspunkte. Beginne damit, den Schreibpfad des Bloom-Filters und die vorhandenen Tests zur Kodierung zu finden, und bestimme dann das erwartete Verhalten für Filter mit geringer Entropie. Abgeschlossen wäre die Aufgabe, wenn ein abgestimmter Kodierungsansatz und eine Testabdeckung vorhanden wären, die zeigen, dass Bloom-Filter korrekt geschrieben und wieder eingelesen werden können.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.