Reduce memory footprint for nulls caching
- Langage dominant
- Java
- Étoiles
- 3.1k
- Forks
- 1.6k
- Merge moyen
- 3 j 12 h
- PR mergées (30 j)
- 33
Description
Scenario:
There is a schema with many optional groups, e.g.
```
message example {
required binary id (UTF8);
optional group a1 (LIST) {
repeated int64 array;
}
optional group a2 (LIST) {
repeated int64 array;
}
...
optional group aN (LIST) {
repeated int64 array;
}
}
```
Many records without optional parameters are written.
In this case groupNullCache will contain many elements which all are zeros.
**Reporter**: [Boris Molodenkov](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=molodenkov)
#### Related issues:
- [Caching nulls on group node to improve write performance on wide schema sparse data](https://github.com/apache/parquet-java/issues/1860) (relates to)
**Note**: *This issue was originally created as [PARQUET-1119](https://issues.apache.org/jira/browse/PARQUET-1119). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
Aucun fichier source ni test n’est indiqué. Commencez par suivre où groupNullCache est créé et alimenté, puis lisez l’issue #1860 concernant la conception actuelle de la mise en cache. Le travail est considéré comme terminé lorsque le stockage des entrées null-cache entièrement nulles est réduit, tout en préservant le comportement d’écriture pertinent ; ajoutez une couverture ciblée là où le comportement actuel du cache est testé.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java
- Domaine
- data-engineering
- Type d'issue
- Refactorisation
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 25/100