apache / apache/parquet-java

[CPP] Unable to read files written by parquet-cpp from parquet-tools

Ouverte
#2,033 12 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Component: Parquet Priority: Major Type: bug
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

I could not read files written by parquet-cpp from parquet-tools and Hive.
Setting field ids in the schema metadata seems to be the problem. We should make setting the field_id optional.

**Reporter**: [Deepak Majeti](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=mdeepak) / @majetideepak
#### Original Issue Attachments:
- [parquet_cpp_example.parquet](https://issues.apache.org/jira/secure/attachment/12849181/parquet_cpp_example.parquet)

**Note**: *This issue was originally created as [PARQUET-838](https://issues.apache.org/jira/browse/PARQUET-838). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez par reproduire l’échec avec le fichier joint parquet_cpp_example.parquet à l’aide de parquet-tools et Hive, puis examinez comment les ID de champ sont écrits dans les métadonnées du schéma de parquet-java. Le travail est terminé lorsque les fichiers écrits par parquet-cpp peuvent être lus par parquet-tools et Hive lorsque les ID de champ ne sont pas requis.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
cpp, java
Domaine
data-engineering
Type d'issue
Bug
Difficulté
3/5
Temps estimé
1-2 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
45/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.