CouncilDataProject / CouncilDataProject/cdp-data

Parallelize mass conversion of transcripts to CSV

Offen
#18 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
enhancement
Vorherrschende Sprache
Jupyter Notebook
Sterne
5
Forks
4
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

Currently, we use `thread_map` to do a lot of data fetching for getting events, sessions, transcripts, videos, etc. However our `store_transcript_as_csv` logic is just a loop that takes a long time. It would be preferable to use `process_map` (or w.e. the function name is) in a similar fashion as all the other processing we do to parallelize this process.

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Beginne damit, die Logik von store_transcript_as_csv zu finden, und vergleiche ihre aktuelle Schleife mit der bestehenden Verwendung von thread_map zum Abrufen von Ereignissen, Sitzungen, Transkripten und Videos. Prüfe, wie process_map an anderer Stelle verwendet wird, und bestätige anschließend den Abschluss, indem du überprüfst, dass die massenhafte Konvertierung von Transkripten in CSV parallelisiert ist, ohne ihre Ausgabe zu ändern.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python
Bereich
data-engineering, performance
Issue-Typ
Refactoring
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.