creativecommons / creativecommons/quantifying
Make Europeana fetch viable
- Lenguaje dominante
- Python
- Estrellas
- 48
- Forks
- 74
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
## Problem
The Europeana data set is too big to fetch all at once, or in its entirety.
- data providers: 4206
- rights: 64
Assuming approximately 1 second per query, the expected duration is approximately 75 hours.
## Description
1. Add counts for rights only (not including data providers)
2. Write a query plan on first run per quarter to map out which queries to make over 30 runs (30 days)
## Alternatives
Parallel queries (probably considered impolite, Timid Robot will ask)
## Additional context
- https://github.com/creativecommons/quantifying/blob/main/sources.md#europeana
## Implementation
- [ ] I would be interested in implementing this feature.
Guía de contribución
Línea de trabajo
Comienza con la sección de Europeana enlazada desde sources.md y sigue el punto de entrada existente para la obtención de datos de Europeana y el flujo de conteo de consultas. Define cómo los conteos solo de derechos y un plan trimestral para la primera ejecución deben cubrir 30 ejecuciones durante 30 días, y verifica después que la programación resultante evita obtener el conjunto de datos completo de una sola vez.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- data-engineering
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Bastante claro
- Aptitud para principiantes
- 42/100