Azure / Azure/MachineLearningNotebooks

Azure wrongly reads Parquet

オープン
#1,713 コメント 6 件 リアクション 4 件 担当者 0 名 GitHub で見る
主要言語
Jupyter Notebook
スター
4.4k
フォーク
2.6k
PR マージ指標
30日以内にマージされた PR はありません

説明

**Setup**

Python=3.8 + azureml-core=1.36.0 + azureml-dataprep=2.26.0 + pyarrow=7.0.0 + pandas=1.4

**Summary**

`to_pandas_dataframe` **wrongly reads certain Parquet datasets**. Data of some columns appears to be internally shuffled.
This was already [reported but closed without a fix](https://docs.microsoft.com/en-us/answers/questions/119459/parquet-file-registered-in-a-tabluar-format-is-loa.html), due to issues with sharing data publicly.
I share the reproducible example below

**How to reproduce**

```
from azureml.core import Workspace, Dataset
import tempfile
import pandas as pd

# prepare data: list of sha-values with some None values
df = pd.read_csv('error_data.csv')

# configure Azure storage
ws = Workspace.from_config()
dstore = ws.datastores.get('your datastore')
dstore_path = 'relative datastore path'
target = (dstore,dstore_path)

# write to Azure storage
with tempfile.TemporaryDirectory() as tmpdir:
df.to_parquet(f'{tmpdir}/df.parquet')
ds=Dataset.File.upload_directory(tmpdir,target,overwrite=True)

# read by two ways: download and open in pandas or use the Azure connector
with tempfile.TemporaryDirectory() as tmpdir:
ds=Dataset.File.from_files(target)
ds.download(tmpdir)
df1 = pd.read_parquet(tmpdir)
ds = Dataset.Tabular.from_parquet_files(target)
df2 = ds.to_pandas_dataframe()

# comparison fails, the data seems displaced :-(
pd.testing.assert_frame_equal(df1,df2)
```

[error_data.csv](https://github.com/Azure/MachineLearningNotebooks/files/8246099/error_data.csv)

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

調査の方向性

Issue の再現可能な例から始め、ダウンロードした pandas DataFrame と Dataset.Tabular.from_parquet_files(...).to_pandas_dataframe() を比較します。Azure Dataset の表形式 Parquet 読み取りパスを追跡し、提供された error_data.csv を使用して pd.testing.assert_frame_equal(df1, df2) で完了を確認します。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
azure, pandas, python
領域
cloud, data-engineering
issue の種類
バグ
難易度
4/5
見積もり時間
3〜5日
活発さ
停滞
明瞭さ
おおむね明確
初心者へのやさしさ
35/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。