MIT-LCP / MIT-LCP/wfdb-python

Feature: Parquet Support

Aperta
#391 1 commento 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Lingua principale
Jupyter Notebook
Stelle
853
Fork
322
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

Extend WFDB-python to include support for Apache Parquet:

https://arrow.apache.org/docs/cpp/parquet.html

Given it's binary and there are c++ libraries out there, I thought it might be easy to at least support some subset of Parquet (or in fact, just generate a header for parquet files that makes a subset of parquet files WFDB compatible).

Benefit: Facilitate compute in AWS and Spark for large datasets

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Direzione di ricerca

Inizia dalla documentazione collegata di Apache Parquet C++ e verifica come WFDB-python rappresenta attualmente i propri formati di dati; l’issue non indica file, punti di ingresso o test. Prima dell’implementazione, definisci il sottoinsieme di Parquet supportato o il comportamento dell’header e come verrà verificata l’interoperabilità con AWS e Spark.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
aws, python, spark
Ambito
data-engineering
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
20/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.