CouncilDataProject / CouncilDataProject/cdp-data

Parallelize mass conversion of transcripts to CSV

Aperta
#18 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
enhancement
Lingua principale
Jupyter Notebook
Stelle
5
Fork
4
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

Currently, we use `thread_map` to do a lot of data fetching for getting events, sessions, transcripts, videos, etc. However our `store_transcript_as_csv` logic is just a loop that takes a long time. It would be preferable to use `process_map` (or w.e. the function name is) in a similar fashion as all the other processing we do to parallelize this process.

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia individuando la logica di store_transcript_as_csv e confronta il suo ciclo attuale con l’uso esistente di thread_map per recuperare eventi, sessioni, trascrizioni e video. Controlla come viene usato process_map altrove, quindi conferma il completamento verificando che la conversione massiva delle trascrizioni in CSV sia parallelizzata senza modificarne l’output.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
data-engineering, performance
Tipo di issue
Refactoring
Difficoltà
3/5
Tempo stimato
1-2 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.