InseeFrLab / InseeFrLab/benchmark_spatial_interpolation

Work program

Offen
#1 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Jupyter Notebook
Sterne
1
Forks
1
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

- Tools to learn:
- `git`, `uv`, `scikit-learn`, s3, MLFlow, Argo, `quarto`.
- scikit-learn: Pipeline, transformer, estimator, CV, transform/fit/predict.
- How to define and use a configuration on SSP Cloud.
- Regarding machine learning algorithms:
- Read the introduction to [ensemble methods](https://inseefrlab.github.io/DT_methodes_ensemblistes/);
- Find and read papers on spatial interpolation using tree-based methods, and produce a literature review.
- Establish the list of algorithms to compare.
- Define the list of metrics to compare.
- Build the datasets:
- Define what sort of data we want to work on.
- Gather real datasets;
- Generate artificial datasets (using `gstools`?);
- Build code that automatically trains a suite of algorithms;
- Train basic models;
- Tune hyperparameters;
- Log models using MLFlow;
- Orchestrate training using Argo (optional).
- Prepare an automated report using Quarto.

Outputs:

- A fully reproducible evaluation pipeline in a clean Github repository.
- A report describing the whole project.
- A slideshow presenting the results.
- A series of clean and well-documented datasets usable for other benchmarks.

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginne mit der verlinkten Einführung in Ensemble-Methoden und prüfe anschließend die vorhandenen Notebooks des Repositorys; definiere dann die Algorithmen, Metriken, Datensätze und den Ansatz zur Reproduzierbarkeit. Als erledigt gilt die Aufgabe, wenn ein sauberes GitHub-Repository mit der automatisierten Evaluierungspipeline, dokumentierten Datensätzen, einem Quarto-Bericht und einer Diashow zur Präsentation der Ergebnisse vorliegt.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
git, jupyter-notebook, scikit-learn
Bereich
data, machine-learning
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
15/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.