creativecommons / creativecommons/quantifying

Make Europeana fetch viable

Abierto
#224 5 comentarios 0 reacciones 0 asignados Ver en GitHub
✨ goal: improvement 💻 aspect: code 🔒 staff only 🚧 status: blocked 🟩 priority: low
Lenguaje dominante
Python
Estrellas
48
Forks
74
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

## Problem
The Europeana data set is too big to fetch all at once, or in its entirety.
- data providers: 4206
- rights: 64

Assuming approximately 1 second per query, the expected duration is approximately 75 hours.

## Description
1. Add counts for rights only (not including data providers)
2. Write a query plan on first run per quarter to map out which queries to make over 30 runs (30 days)

## Alternatives
Parallel queries (probably considered impolite, Timid Robot will ask)

## Additional context
- https://github.com/creativecommons/quantifying/blob/main/sources.md#europeana

## Implementation

- [ ] I would be interested in implementing this feature.

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza con la sección de Europeana enlazada desde sources.md y sigue el punto de entrada existente para la obtención de datos de Europeana y el flujo de conteo de consultas. Define cómo los conteos solo de derechos y un plan trimestral para la primera ejecución deben cubrir 30 ejecuciones durante 30 días, y verifica después que la programación resultante evita obtener el conjunto de datos completo de una sola vez.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python
Área
data-engineering
Tipo de issue
Nueva funcionalidad
Dificultad
4/5
Tiempo estimado
3-5 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
42/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.