CouncilDataProject / CouncilDataProject/cdp-data
Parallelize mass conversion of transcripts to CSV
- Lingua principale
- Jupyter Notebook
- Stelle
- 5
- Fork
- 4
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
Currently, we use `thread_map` to do a lot of data fetching for getting events, sessions, transcripts, videos, etc. However our `store_transcript_as_csv` logic is just a loop that takes a long time. It would be preferable to use `process_map` (or w.e. the function name is) in a similar fashion as all the other processing we do to parallelize this process.
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia individuando la logica di store_transcript_as_csv e confronta il suo ciclo attuale con l’uso esistente di thread_map per recuperare eventi, sessioni, trascrizioni e video. Controlla come viene usato process_map altrove, quindi conferma il completamento verificando che la conversione massiva delle trascrizioni in CSV sia parallelizzata senza modificarne l’output.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- data-engineering, performance
- Tipo di issue
- Refactoring
- Difficoltà
- 3/5
- Tempo stimato
- 1-2 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 35/100