MIT-LCP / MIT-LCP/wfdb-python

Feature: Parquet Support

Ouverte
#391 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Langage dominant
Jupyter Notebook
Étoiles
853
Forks
322
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

Extend WFDB-python to include support for Apache Parquet:

https://arrow.apache.org/docs/cpp/parquet.html

Given it's binary and there are c++ libraries out there, I thought it might be easy to at least support some subset of Parquet (or in fact, just generate a header for parquet files that makes a subset of parquet files WFDB compatible).

Benefit: Facilitate compute in AWS and Spark for large datasets

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Piste de recherche

Commencez par la documentation liée d’Apache Parquet C++ et examinez comment WFDB-python représente actuellement ses formats de données ; l’issue ne nomme aucun fichier, point d’entrée ni test. Avant l’implémentation, définissez le sous-ensemble de Parquet pris en charge ou le comportement de l’en-tête, ainsi que la manière dont l’interopérabilité avec AWS et Spark sera vérifiée.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
aws, python, spark
Domaine
data-engineering
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
20/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.