provide an option to skip a page in case corrupted bytes occur
- Langage dominant
- Java
- Étoiles
- 3.1k
- Forks
- 1.6k
- Merge moyen
- 3 j 12 h
- PR mergées (30 j)
- 33
Description
In case of hardware failure (disk, memory, etc), there might be corrupted bytes. That will result in ArrayIndexOutOfBoundException or/and data garbled.
Currently, jobs reading those Parquet files will fail unless the corrupted files are deleted/moved.
Currently page metadata has a CRC field (not used so far), which can be used to check integrity of the page. If page data is corrupted, skip the whole page.
related issue: PARQUET-148
**Reporter**: [Tongjie Chen](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=tongjie) / @tongjiechen
**Note**: *This issue was originally created as [PARQUET-149](https://issues.apache.org/jira/browse/PARQUET-149). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
Commencez par le chemin de lecture des pages Parquet et la gestion des métadonnées de page décrite dans l’issue ; examinez comment le champ CRC existant peut être vérifié avant que les données de la page ne soient consommées. Reproduisez la corruption ou ajoutez une couverture ciblée pour les octets de page corrompus, puis vérifiez que la page affectée est ignorée tandis que le job continue, au lieu d’échouer ou de renvoyer des données altérées.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java
- Domaine
- data-engineering
- Type d'issue
- Fonctionnalité
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 30/100