Feature: Parquet Support
オープン
まだ誰も着手していません。
- 主要言語
- Jupyter Notebook
- スター
- 853
- フォーク
- 322
- PR マージ指標
- 30日以内にマージされた PR はありません
説明
Extend WFDB-python to include support for Apache Parquet:
https://arrow.apache.org/docs/cpp/parquet.html
Given it's binary and there are c++ libraries out there, I thought it might be easy to at least support some subset of Parquet (or in fact, just generate a header for parquet files that makes a subset of parquet files WFDB compatible).
Benefit: Facilitate compute in AWS and Spark for large datasets
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
調査の方向性
リンクされている Apache Parquet C++ のドキュメントから始め、WFDB-python が現在どのようにデータ形式を表現しているかを確認してください。この issue では、ファイル、エントリーポイント、テストは指定されていません。実装の前に、サポートする Parquet のサブセットまたはヘッダーの動作と、AWS および Spark との相互運用性をどのように検証するかを定義してください。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- aws, python, spark
- 領域
- data-engineering
- issue の種類
- 機能追加
- 難易度
- 5/5
- 見積もり時間
- 1週間以上
- 活発さ
- 停滞
- 明瞭さ
- 説明が足りない
- 初心者へのやさしさ
- 20/100