microsoft / microsoft/PlanetaryComputerExamples

multiple reads of nasa-nex-gddp-cmip6 dataset from MultiZarrToZarr concatenated metadata returns all nans

Offen
#289 2 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

Vorherrschende Sprache
Jupyter Notebook
Sterne
455
Forks
225
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

Simply running twice cells 13 & 14 of the notebook that read and plot point single variable time-series for a point will reproduce this issue where the first run will have the valid values but second will be all nans. I encountered this when parallelizing reading of the files with dask that results in multiple reads and the unexpected result.

Beitragsleitfaden

Beitragsleitfaden öffnen

Erste Schritte

  1. Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
  3. Forke das Repository und arbeite in einem Branch.
  4. Öffne einen Pull Request, der die Issue-Nummer nennt.

Rechercherichtung

Beginne mit den Zellen 13 und 14 in datasets/nasa-nex-gddp-cmip6/nasa-nex-gddp-cmip6-example.ipynb und reproduziere das zweimalige Lesen der Punktzeitreihe. Untersuche das Verhalten der von MultiZarrToZarr verketteten Metadaten, einschließlich wiederholter oder paralleler Lesevorgänge. Als erledigt gilt die Aufgabe, wenn der zweite Lesevorgang dieselben gültigen Werte wie der erste zurückgibt und nicht nur NaNs.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
jupyter-notebook
Bereich
data-engineering
Issue-Typ
Bug
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
45/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.