Azure / Azure/MachineLearningNotebooks

Cache dataset locally

Abierto
#1,357 2 comentarios 0 reacciones 0 asignados Ver en GitHub
ADO Data4ML product-issue
Lenguaje dominante
Jupyter Notebook
Estrellas
4.4k
Forks
2.6k
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

I write a score script to be used in a batch scoring pipeline. I can use `ds.to_pandas_dataframe()` to get a dataframe, and by a bit of parameterizing I can run the script both locally and in-the-cloud. But when I run it locally it downloads the dataset every time. It would be nice if it was possible (maybe default off) to cache the dataset locally for faster execution.

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Línea de trabajo

El payload no menciona ningún archivo ni prueba. Empieza rastreando la llamada ds.to_pandas_dataframe() del script de scoring y comparando la ejecución local con la ejecución en la nube. Se considera terminado cuando las ejecuciones locales pueden reutilizar un dataset en caché mediante una opción definida o de forma predeterminada, mientras el comportamiento en la nube sigue siendo utilizable.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
jupyter-notebook, python
Área
cloud, data, machine-learning
Tipo de issue
Nueva funcionalidad
Dificultad
4/5
Tiempo estimado
3-5 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
30/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.