CouncilDataProject / CouncilDataProject/cdp-data

Prototype delayed dask dataframes for better computation scaling

Abierto
#9 0 comentarios 0 reacciones 0 asignados Ver en GitHub
enhancement
Lenguaje dominante
Jupyter Notebook
Estrellas
5
Forks
4
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

Currently all computation is multithreaded by default and that doesn't leave a lot of room to the user in terms of deciding how and when they want to actually gather data or compute a result.

The datasets module can easily be switched over to dask for data gathering and caching

The keywords module should be looked at for how to use dask dataframes for just-in-time compute and out-of-memory compute.

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Empieza leyendo el módulo datasets para entender la recopilación y el almacenamiento en caché actuales de datos; después, inspecciona el módulo keywords para conocer el comportamiento de cálculo existente. El prototipo debería admitir la recopilación o el cálculo diferidos y cubrir el uso de dataframe just-in-time y out-of-memory, pero el issue no define pruebas ni criterios de aceptación específicos.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Área
data-engineering, performance
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
30/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.