creativecommons / creativecommons/quantifying
Make Europeana fetch viable
- Vorherrschende Sprache
- Python
- Sterne
- 48
- Forks
- 74
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
## Problem
The Europeana data set is too big to fetch all at once, or in its entirety.
- data providers: 4206
- rights: 64
Assuming approximately 1 second per query, the expected duration is approximately 75 hours.
## Description
1. Add counts for rights only (not including data providers)
2. Write a query plan on first run per quarter to map out which queries to make over 30 runs (30 days)
## Alternatives
Parallel queries (probably considered impolite, Timid Robot will ask)
## Additional context
- https://github.com/creativecommons/quantifying/blob/main/sources.md#europeana
## Implementation
- [ ] I would be interested in implementing this feature.
Beitragsleitfaden
Rechercherichtung
Beginne mit dem in sources.md verlinkten Europeana-Abschnitt und verfolge den bestehenden Europeana-Einstiegspunkt für das Abrufen sowie den Ablauf der Abfragezählung. Lege fest, wie Zählungen nur für Rechte und ein vierteljährlicher Plan für den ersten Lauf 30 Ausführungen über 30 Tage abdecken sollen, und überprüfe anschließend, dass der resultierende Zeitplan das Abrufen des vollständigen Datensatzes auf einmal vermeidet.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- data-engineering
- Issue-Typ
- Feature
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 42/100