daisybio / daisybio/preprocess_drp_data

Caution with BeatAML2

Offen
#4 0 Kommentare 1 Reaktion 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Jupyter Notebook
Sterne
3
Forks
1
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

In the raw data, there is the column `normalized_viability`, which we treat as the response column. It ranges from 0 to 7703 (an outlier; the next value is 3743). In the original publication, the authors state the normalized viability is normalized to lie between 0 and 100. This is clearly not the case. However, there is also neither a positive nor a negative control, nor a raw response column, so there is really nothing we can do but normalize these values to lie between 0 and 1 with CurveCator.

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginnen Sie mit der Überprüfung der rohen BeatAML2-Daten und der im Issue beschriebenen Spalte `normalized_viability`. Prüfen Sie die Aussage zur Normalisierung in der Originalpublikation und wie CurveCator diese Werte derzeit verarbeitet. Als erledigt gilt die Aufgabe, wenn die Entscheidung zur Vorverarbeitung dokumentiert oder korrigiert ist, sodass die Antwortwerte trotz der fehlenden Kontrollen und der rohen Antwortspalte konsistent normalisiert werden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
jupyter-notebook
Bereich
data
Issue-Typ
Bug
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
42/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.