Azure / Azure/MachineLearningNotebooks
AML: When using ParallelRun with a Tabular Dataset, is the delimiter always a `space` - clarify documenation/example
Ninguém assumiu esta issue ainda.
- Linguagem predominante
- Jupyter Notebook
- Estrelas
- 4.4k
- Forks
- 2.6k
- Métricas de merge de PRs
- Nenhum PR com merge em 30d
Descrição
@keijik @cody-dkdc @gregce
In this example notebook you show the delimter in the file that is written to as being a space. Using space a delimiter seems like a really dangerous choice. Can you change what the delimiter is? If so how? It seems like from this example that this is the default delimiter for tabular datasets which seem problematic.

The scoring script for this example is here as you can see, space is not indicated anywhere in the scoring script, so how does this delimiter come out? If this is the default delimiter, I think this is worth explaining.
import io
import pickle
import argparse
import numpy as np
from azureml.core.model import Model
from sklearn.linear_model import LogisticRegression
from azureml_user.parallel_run import EntryScript
def init():
global iris_model
logger = EntryScript().logger
logger.info("init() is called.")
parser = argparse.ArgumentParser(description="Iris model serving")
parser.add_argument('--model_name', dest="model_name", required=True)
args, unknown_args = parser.parse_known_args()
model_path = Model.get_model_path(args.model_name)
with open(model_path, 'rb') as model_file:
iris_model = pickle.load(model_file)
def run(input_data):
logger = EntryScript().logger
logger.info("run() is called with: {}.".format(input_data))
# make inference
num_rows, num_cols = input_data.shape
pred = iris_model.predict(input_data).reshape((num_rows, 1))
# cleanup output
result = input_data.drop(input_data.columns[4:], axis=1)
result['variety'] = pred
return result
Guia de contribuição
Nenhum guia de contribuição indexado para este repositório
Primeiros passos
- Leia a issue inteira e depois o guia de contribuição do projeto.
- Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
- Faça um fork do repositório e trabalhe em uma branch.
- Abra um pull request que referencie o número da issue.
Direção de pesquisa
Comece com o exemplo vinculado tabular-dataset-inference-iris.ipynb e Code/iris_score.py e, em seguida, inspecione como a saída tabular de ParallelRun é produzida. Confirme se um espaço é o delimitador padrão e documente como ele pode ser alterado, ou esclareça explicitamente o comportamento do delimitador no exemplo. O trabalho estará concluído quando o notebook e a explicação complementar não deixarem mais o comportamento do delimitador ambíguo.
Escrita pelo modelo de indexação a partir do texto da issue.
Avaliação
- Stack de tecnologia
- azure, jupyter-notebook, python
- Domínio
- documentation, machine-learning
- Tipo de issue
- Documentação
- Dificuldade
- 2/5
- Tempo estimado
- 1-3 horas
- Status de atividade
- Estagnada
- Clareza
- Razoavelmente clara
- Facilidade para iniciantes
- 45/100