CouncilDataProject / CouncilDataProject/cdp-data

Prototype delayed dask dataframes for better computation scaling

Offen
#9 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
enhancement
Vorherrschende Sprache
Jupyter Notebook
Sterne
5
Forks
4
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

Currently all computation is multithreaded by default and that doesn't leave a lot of room to the user in terms of deciding how and when they want to actually gather data or compute a result.

The datasets module can easily be switched over to dask for data gathering and caching

The keywords module should be looked at for how to use dask dataframes for just-in-time compute and out-of-memory compute.

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Lies zunächst das Modul datasets, um die aktuelle Datenerfassung und das Caching zu verstehen, und untersuche anschließend das Modul keywords auf das vorhandene Berechnungsverhalten. Der Prototyp sollte verzögerte Datenerfassung oder Berechnung unterstützen und die dataframe-Nutzung just-in-time sowie out-of-memory abdecken, aber das Issue definiert keine spezifischen Tests oder Akzeptanzkriterien.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Bereich
data-engineering, performance
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
30/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.