apache / apache/parquet-java

Reduce memory pressure when reading footers

Ouverte
#1,385 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub
Component: Parquet Priority: Major Type: bug
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

I encountered OOMs reading metadata for a dataset with 500+ columns, many of them quite sparse.

We can reduce memory utilization significantly.

**Reporter**: [Dmitriy V. Ryaboy](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=dvryaboy) / @dvryaboy

**Note**: *This issue was originally created as [PARQUET-11](https://issues.apache.org/jira/browse/PARQUET-11). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez par reproduire la condition de manque de mémoire lors de la lecture des métadonnées d’un dataset comportant plus de 500 colonnes creuses, puis suivez le chemin de lecture du footer. L’issue ne mentionne aucun fichier ni test ; identifiez donc le code pertinent des métadonnées et du footer avant de décider de la modification. Le travail est terminé lorsque l’utilisation de la mémoire est nettement réduite sans modifier le résultat de la lecture des métadonnées.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java
Domaine
data-engineering, performance
Type d'issue
Bug
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
30/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.