Perform encoding before bloom filters write out
- Vorherrschende Sprache
- Java
- Sterne
- 3.1k
- Forks
- 1.6k
- Ø Merge
- 3 T. 12 Std.
- Gemergte PRs (30 T.)
- 33
Beschreibung
When entropy of bloom filter is low say nearly all 0 or all 1, we may want to consider to use encoding to save space.
**Reporter**: [Junjie Chen](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=junjie) / @chenjunjiedada
**Note**: *This issue was originally created as [PARQUET-1495](https://issues.apache.org/jira/browse/PARQUET-1495). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Rechercherichtung
Das Issue nennt keine Dateien, Tests oder Einstiegspunkte. Beginne damit, den Schreibpfad des Bloom-Filters und die vorhandenen Tests zur Kodierung zu finden, und bestimme dann das erwartete Verhalten für Filter mit geringer Entropie. Abgeschlossen wäre die Aufgabe, wenn ein abgestimmter Kodierungsansatz und eine Testabdeckung vorhanden wären, die zeigen, dass Bloom-Filter korrekt geschrieben und wieder eingelesen werden können.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- java
- Bereich
- data-engineering
- Issue-Typ
- Feature
- Schwierigkeit
- 5/5
- Geschätzter Aufwand
- Über eine Woche
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 25/100