Azure / Azure/MachineLearningNotebooks

Cache dataset locally

Offen
#1,357 2 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
ADO Data4ML product-issue
Vorherrschende Sprache
Jupyter Notebook
Sterne
4.4k
Forks
2.6k
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

I write a score script to be used in a batch scoring pipeline. I can use `ds.to_pandas_dataframe()` to get a dataframe, and by a bit of parameterizing I can run the script both locally and in-the-cloud. But when I run it locally it downloads the dataset every time. It would be nice if it was possible (maybe default off) to cache the dataset locally for faster execution.

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Der Payload nennt keine Datei und keinen Test. Beginne damit, den Aufruf ds.to_pandas_dataframe() im Score-Skript nachzuverfolgen und die lokale Ausführung mit der Ausführung in der Cloud zu vergleichen. Erledigt ist es, wenn lokale Läufe einen zwischengespeicherten Datensatz über eine definierte Option oder standardmäßig wiederverwenden können, während das Verhalten in der Cloud weiterhin nutzbar bleibt.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
jupyter-notebook, python
Bereich
cloud, data, machine-learning
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
30/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.