aws / aws/amazon-redshift-python-driver

Missing support for PyArrow types in Pandas dataframes

未關閉
#228 1 則留言 1 個 reaction 已指派 0 人 在 GitHub 檢視
主要語言
Python
星號
220
分支
86
PR 合併指標
30 天內沒有已合併 PR

描述

Most of the data ingestion utilities (`pd.read_csv`, `pd.read_parquet`, `pd.read_sql`) since Pandas 2.2 include a `dtype_backend='pyarrow'` option to use PyArrow types instead of NumPy backend.

It would be awesome if there was support for this.

貢獻指南

開啟貢獻指南

研究方向

該 issue 提到了 pd.read_csv、pd.read_parquet 和 pd.read_sql,但沒有提供任何儲存庫檔案或測試。首先定位建構 Pandas dataframe 的資料擷取路徑,並檢查目前的 dtype 處理;為 dtype_backend='pyarrow' 建立涵蓋範圍,然後驗證這三個資料擷取路徑都能處理基於 PyArrow 的 dataframe。

由索引模型根據 Issue 內容生成。

評估

技術堆疊
pandas, python
領域
data
Issue 類型
功能
難度
4/5
預估耗時
3-5 天
活躍度
停滯
描述清晰度
需要釐清
新手友好度
30/100

把新 issue 寄到你的電子郵件信箱

精選適合新手參與的 GitHub issue 摘要。