Better documentation of behaviour with irregular source chunks
- Lingua principale
- Python
- Stelle
- 170
- Fork
- 15
- Merge medio
- 18h 27m
- PR unite (30g)
- 1
Descrizione
Hiya!
In some source datasets the original chunks have irregular sizes. For example one netcdf file per year, where some years are leap years hence shorter than others.
Although the data model would seem to support this in principle, I couldn't get Rechunk or ConsolidateChunks to work without regular source chunk sizes.
Is this a fundamental limitation or something that could be in scope to address? And do you have any recommendations for getting data like this into regular chunks? In the leap year case, first splitting the source chunks into one chunk per day using SplitChunks could be an option. Although in general this would require splitting into chunks of `gcd(*all_possible_source_chunk_sizes)` which could be too small.
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia esaminando il comportamento di Rechunk e ConsolidateChunks con dimensioni irregolari dei chunk sorgente, incluso l’esempio dell’anno bisestile nell’issue. Determina se la limitazione è fondamentale e quali indicazioni, come il pre-processing con SplitChunks, dovrebbero essere documentate; il lavoro è completo quando la limitazione e le raccomandazioni sono spiegate chiaramente.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- data-engineering
- Tipo di issue
- Documentazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 25/100