CouncilDataProject / CouncilDataProject/cdp-data
Prototype delayed dask dataframes for better computation scaling
- Lenguaje dominante
- Jupyter Notebook
- Estrellas
- 5
- Forks
- 4
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
Currently all computation is multithreaded by default and that doesn't leave a lot of room to the user in terms of deciding how and when they want to actually gather data or compute a result.
The datasets module can easily be switched over to dask for data gathering and caching
The keywords module should be looked at for how to use dask dataframes for just-in-time compute and out-of-memory compute.
Guía de contribución
Línea de trabajo
Empieza leyendo el módulo datasets para entender la recopilación y el almacenamiento en caché actuales de datos; después, inspecciona el módulo keywords para conocer el comportamiento de cálculo existente. El prototipo debería admitir la recopilación o el cálculo diferidos y cubrir el uso de dataframe just-in-time y out-of-memory, pero el issue no define pruebas ni criterios de aceptación específicos.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Área
- data-engineering, performance
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 30/100