Azure / Azure/MachineLearningNotebooks

Cache dataset locally

Aperta
#1,357 2 commenti 0 reazioni 0 assegnatari Vedi su GitHub
ADO Data4ML product-issue
Lingua principale
Jupyter Notebook
Stelle
4.4k
Fork
2.6k
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

I write a score script to be used in a batch scoring pipeline. I can use `ds.to_pandas_dataframe()` to get a dataframe, and by a bit of parameterizing I can run the script both locally and in-the-cloud. But when I run it locally it downloads the dataset every time. It would be nice if it was possible (maybe default off) to cache the dataset locally for faster execution.

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Il payload non indica alcun file o test. Inizia tracciando la chiamata ds.to_pandas_dataframe() dello script di scoring e confrontando l'esecuzione locale con quella nel cloud. Il lavoro è completato quando le esecuzioni locali possono riutilizzare un dataset memorizzato nella cache tramite un'opzione definita o per impostazione predefinita, mentre il comportamento nel cloud rimane utilizzabile.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
jupyter-notebook, python
Ambito
cloud, data, machine-learning
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
30/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.