Perform encoding before bloom filters write out
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 3 d 12 h
- PR fusionados (30 d)
- 33
Descripción
When entropy of bloom filter is low say nearly all 0 or all 1, we may want to consider to use encoding to save space.
**Reporter**: [Junjie Chen](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=junjie) / @chenjunjiedada
**Note**: *This issue was originally created as [PARQUET-1495](https://issues.apache.org/jira/browse/PARQUET-1495). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
El issue no especifica archivos, pruebas ni puntos de entrada. Empieza localizando la ruta de escritura del filtro de Bloom y las pruebas existentes relacionadas con la codificación; después, determina el comportamiento esperado para los filtros de baja entropía. La tarea estaría terminada cuando hubiera un enfoque de codificación acordado y cobertura que demostrara que los filtros de Bloom se escriben correctamente y se pueden volver a leer.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- java
- Área
- data-engineering
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100