appendRowGroup will loose pageIndex
- Langage dominant
- Java
- Étoiles
- 3.1k
- Forks
- 1.6k
- Merge moyen
- 3 j 12 h
- PR mergées (30 j)
- 33
Description
Currently,
org.apache.parquet.hadoop.ParquetFileWriter#appendFile(org.apache.parquet.io.InputFile) uses appendRowGroup method to concate parquet row group. However, appendRowGroup method **looses** column index.
```java
// code placeholder
public void appendRowGroup(SeekableInputStream from, BlockMetaData rowGroup,
boolean dropColumns) throws IOException {
....
// TODO: column/offset indexes are not copied
// (it would require seeking to the end of the file for each row groups)
currentColumnIndexes.add(null);
currentOffsetIndexes.add(null);
}
```
Look forward to functionality that support append with page index.
**Reporter**: [GANHONGNAN](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=NathanKan)
**Note**: *This issue was originally created as [PARQUET-2340](https://issues.apache.org/jira/browse/PARQUET-2340). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
Commencez dans parquet-hadoop/src/main/java/org/apache/parquet/hadoop/ParquetFileWriter.java, au niveau de appendFile(InputFile) et appendRowGroup. Suivez la manière dont les index de colonnes et d’offset des groupes de lignes sont représentés et pourquoi la méthode actuelle ajoute des entrées null. Examinez la logique environnante du writer et les tests existants, puis définissez l’achèvement de sorte que les groupes de lignes ajoutés conservent leurs index de pages.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java
- Domaine
- data-engineering
- Type d'issue
- Fonctionnalité
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 35/100