creativecommons / creativecommons/quantifying

[Feature] Post-GSoC '24: Solidify Processing Scripts for Quarterly Analysis

Ouverte
#124 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub
✨ goal: improvement 🏁 status: ready for work 💬 talk: discussion 💻 aspect: code 🟩 priority: low
Langage dominant
Python
Étoiles
48
Forks
74
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

## Context

Automating Quantifying the Commons was a project endeavor for the Google Summer of Code 2024 program, in which a baseline automation software for data gathering, processing, and analysis was successfully developed. However given the time and resource constraints that we had to consider, there are still addressable endeavors to improve this codebase over the upcoming quarters and years. This is the first (1) of five (5) issues raised specifically for post-GSoC contributions.

## Problem

Due to only having one quarter’s worth of data, current processing scripts (`2-process`) are not fully optimized for long-term data analysis, which makes it difficult to accurately assess trends and patterns over quarterly periods.

## Description

This feature involves refining the processing scripts to handle data collected over a larger period, enabling more robust quarterly analysis. The focus will be on adding code that can effectively compare details of each data source by quarter (ex. `2024Q3` data is compared to all previous quarters’ data) and adding them into separate datasets for report generation.

**NOTE**: since contributing to this specific issue is limited by access to API data fetching and the fact that the solution is long-term, this issue is being set as a discussion for all open-source developers to be able to pitch their ideas for final implementation by the developer(s) who work on the codebase.

## Implementation

- [x] I would be interested in implementing this feature.

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

Commencez par lire les scripts de traitement sous `2-process` et retracez la manière dont les données récupérées via l'API sont collectées et représentées d'un trimestre à l'autre. Le résultat attendu est de disposer de jeux de données distincts comparant chaque source de données, telle que 2024Q3, à tous les trimestres précédents pour la génération des rapports ; les détails d'implémentation restent ouverts à discussion.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
python
Domaine
data-engineering
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.