apache / apache/parquet-java

Vectorized API to support Column Index in Apache Spark

Ouverte
#2,476 10 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Component: Java Component: Parquet Priority: Major Type: enhancement
Langage dominant
Java
Étoiles
3.1k
Forks
1.6k
Merge moyen
3 j 12 h
PR mergées (30 j)
33

Description

As per the comment on https://issues.apache.org/jira/browse/SPARK-26345. Its seems like Apache Spark doesn't support Column Index until we disable vectorizedReader in Spark - which will have other performance implications. As per  @zivanfi  , parquet-mr should implement a Vectorized API. Is it already implemented or any pull request for the same?

**Reporter**: [Felix Kizhakkel Jose](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=FelixKJose) / @FelixKJose

**Note**: *This issue was originally created as [PARQUET-1830](https://issues.apache.org/jira/browse/PARQUET-1830). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

L’issue renvoie à SPARK-26345 et demande si parquet-mr dispose déjà d’une API vectorisée ou d’une pull request associée ; commencez par examiner la discussion liée et vérifier l’implémentation actuelle de parquet-java. Done n’est pas défini, car le rapport demande si la prise en charge existe plutôt que de spécifier une modification concrète.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java
Domaine
data-engineering
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
20/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.