creativecommons / creativecommons/quantifying

Make Europeana fetch viable

Offen
#224 5 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
✨ goal: improvement 💻 aspect: code 🔒 staff only 🚧 status: blocked 🟩 priority: low
Vorherrschende Sprache
Python
Sterne
48
Forks
74
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

## Problem
The Europeana data set is too big to fetch all at once, or in its entirety.
- data providers: 4206
- rights: 64

Assuming approximately 1 second per query, the expected duration is approximately 75 hours.

## Description
1. Add counts for rights only (not including data providers)
2. Write a query plan on first run per quarter to map out which queries to make over 30 runs (30 days)

## Alternatives
Parallel queries (probably considered impolite, Timid Robot will ask)

## Additional context
- https://github.com/creativecommons/quantifying/blob/main/sources.md#europeana

## Implementation

- [ ] I would be interested in implementing this feature.

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Beginne mit dem in sources.md verlinkten Europeana-Abschnitt und verfolge den bestehenden Europeana-Einstiegspunkt für das Abrufen sowie den Ablauf der Abfragezählung. Lege fest, wie Zählungen nur für Rechte und ein vierteljährlicher Plan für den ersten Lauf 30 Ausführungen über 30 Tage abdecken sollen, und überprüfe anschließend, dass der resultierende Zeitplan das Abrufen des vollständigen Datensatzes auf einmal vermeidet.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
42/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.