Azure / Azure/MachineLearningNotebooks
Azure wrongly reads Parquet
- Linguagem predominante
- Jupyter Notebook
- Estrelas
- 4.4k
- Forks
- 2.6k
- Métricas de merge de PRs
- Nenhum PR com merge em 30d
Descrição
**Setup**
Python=3.8 + azureml-core=1.36.0 + azureml-dataprep=2.26.0 + pyarrow=7.0.0 + pandas=1.4
**Summary**
`to_pandas_dataframe` **wrongly reads certain Parquet datasets**. Data of some columns appears to be internally shuffled.
This was already [reported but closed without a fix](https://docs.microsoft.com/en-us/answers/questions/119459/parquet-file-registered-in-a-tabluar-format-is-loa.html), due to issues with sharing data publicly.
I share the reproducible example below
**How to reproduce**
```
from azureml.core import Workspace, Dataset
import tempfile
import pandas as pd
# prepare data: list of sha-values with some None values
df = pd.read_csv('error_data.csv')
# configure Azure storage
ws = Workspace.from_config()
dstore = ws.datastores.get('your datastore')
dstore_path = 'relative datastore path'
target = (dstore,dstore_path)
# write to Azure storage
with tempfile.TemporaryDirectory() as tmpdir:
df.to_parquet(f'{tmpdir}/df.parquet')
ds=Dataset.File.upload_directory(tmpdir,target,overwrite=True)
# read by two ways: download and open in pandas or use the Azure connector
with tempfile.TemporaryDirectory() as tmpdir:
ds=Dataset.File.from_files(target)
ds.download(tmpdir)
df1 = pd.read_parquet(tmpdir)
ds = Dataset.Tabular.from_parquet_files(target)
df2 = ds.to_pandas_dataframe()
# comparison fails, the data seems displaced :-(
pd.testing.assert_frame_equal(df1,df2)
```
[error_data.csv](https://github.com/Azure/MachineLearningNotebooks/files/8246099/error_data.csv)
Guia de contribuição
Nenhum guia de contribuição indexado para este repositório
Direção de pesquisa
Comece pelo exemplo reproduzível na issue e compare o pandas DataFrame baixado com Dataset.Tabular.from_parquet_files(...).to_pandas_dataframe(). Rastreie o caminho de leitura de Parquet tabular do Azure Dataset e, em seguida, verifique a conclusão com pd.testing.assert_frame_equal(df1, df2) usando o arquivo error_data.csv fornecido.
Escrita pelo modelo de indexação a partir do texto da issue.
Avaliação
- Stack de tecnologia
- azure, pandas, python
- Domínio
- cloud, data-engineering
- Tipo de issue
- Bug
- Dificuldade
- 4/5
- Tempo estimado
- 3-5 dias
- Status de atividade
- Estagnada
- Clareza
- Razoavelmente clara
- Facilidade para iniciantes
- 35/100