ThinkR-open / ThinkR-open/datadiff

[design] Ergonomie de compare_datasets_from_yaml : 17 paramètres, franglais $reponse, triple all_passed, WARN/STOP jumeaux — proposition d'API 0.5

Open
#33 1 comment 0 reactions 0 assignees View on GitHub

Nobody has claimed this yet.

Dominant language
R
Stars
6
Forks
0
PR merge metrics
No merged PRs in 30d

Description

Contexte

Constats UX convergents sur la fonction centrale (aucun n'est un bug isolé — c'est le design d'ensemble) :

  1. 17 paramètres à plat, dont 5 de pur passe-plat vers pointblank::interrogate() (extract_failed, get_first_n, sample_n, sample_frac, sample_limit) et 1 actif sur un seul chemin (duckdb_memory_limit).
  2. Franglais : argument data_reference (EN) mais champ retour $reponse (FR, sans accent) au milieu de champs anglais ; messages 100 % anglais mais rapport par défaut en français.
  3. Redondances du retour : all_passed en 3 exemplaires ($all_passed, $summary$all_passed, pointblank::all_passed($reponse)) ; $agent non interrogé (et factice sur le fast-path all-pass) sans usage utilisateur identifié.
  4. warn_at/stop_at identiques (1e-14, écrits en littéral décimal de 14 zéros) : WARN et STOP se déclenchent toujours ensemble — le niveau WARN n'apporte rien en l'état ; et la reconstitution warn/stop du rapport suppose des seuils fractionnaires alors que pointblank interprète ≥ 1 comme un compte absolu.
  5. Messages laconiques : message("key is missing") à chaque comparaison positionnelle légitime ; contraste avec les excellents warnings doublons/type_mismatch (contexte + exemples + action).
  6. Nom : compare_datasets_from_yaml alors que le YAML est optionnel depuis 0.1.5 — un alias compare_datasets() refléterait l'usage réel.
  7. ref_suffix expose un détail d'implémentation ; write_rules_template() a 19 paramètres au nommage incohérent (na_equal_default vs numeric_abs) et écrit par défaut rules.yaml dans le répertoire courant.

Proposition (à discuter)

compare_datasets(reference, candidate, key = NULL, rules = NULL,
                 extract = extract_opts(first_n = NULL, sample_n = NULL, ...),
                 engine  = engine_opts(duckdb_memory_limit = "8GB", ...),
                 lang = getOption("datadiff.lang", "en"), ...)
# retour de classe datadiff_result : $passed, $coverage, $summary, $report (lazy), print() dédié
# compare_datasets_from_yaml() conservé en alias rétrocompatible

Critères de succès

  • RFC/discussion tranchée sur : langue de l'API (proposition : anglais partout, reponsereport avec alias déprécié), objets d'options, sort de $agent, alias compare_datasets().
  • Cycle de dépréciation propre (warnings conditionnels, une version de grâce, entrées NEWS).
  • warn_at/stop_at : sémantique documentée, défauts distincts ou paramètre unique fail_at.
  • Messages uniformisés sur le style des bons warnings existants (contexte + conséquence + action).
  • Vignette et README réécrits sur la nouvelle surface, anciens noms documentés en annexe migration.

Contributor guide

No contributing guide indexed for this repository

First steps

  1. Read the whole issue, then the project's contributing guide.
  2. Comment on the issue to say you are picking it up — it saves two people doing the same work.
  3. Fork the repository and make your change on a branch.
  4. Open a pull request that references the issue number.

Research direction

Start by reviewing compare_datasets_from_yaml() and write_rules_template(), then trace the pointblank::interrogate() argument flow and existing warning messages. Resolve the RFC questions, define the deprecation cycle and threshold semantics, and update the vignette, README, and NEWS entries so the new and legacy surfaces are documented.

Written by the indexing model from the issue text.

Assessment

Tech stack
r
Domain
api, developer-experience, documentation
Issue type
Refactor
Difficulty
5/5
Estimated time
Over a week
Activity status
Quiet
Clarity
Mostly clear
Newbie friendliness
35/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.