daisybio / daisybio/preprocess_drp_data

Normalization for CCLE

Abierto
#3 0 comentarios 1 reacción 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Lenguaje dominante
Jupyter Notebook
Estrellas
3
Forks
1
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

I think the normalisation for CCLE is wrong.

Original code:

# transfroms [0, -100] to [1,0] for curvecurator processing
def transform_activity_range(raw_df):
    raw_df["Activity Data (median)"] = raw_df["Activity Data (median)"] / 100 + 1
    raw_df["Amax"] = raw_df["Amax"] / 100 + 1

There is no explicit control column in the raw data, but there is this Amax value, which seems to be unique per cell line/drug combination. In the original supplementary methods, the authors state that

Amax is the maximal activity value reached within a model

In the raw data, Amax is kind of the maximum response; it is always close to the response value associated with the highest dose (8µM). So it seems to be a positive control rather than a negative control, like DMSO would be.

I think it should be

raw_df["response"] = 1 - raw_df["Activity Data (median)"]/raw_df["Amax"]

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Línea de trabajo

Comienza localizando el punto de entrada del preprocesamiento de CCLE y la función transform_activity_range; después, inspecciona cómo se utilizan "Activity Data (median)", "Amax" y response en las etapas posteriores. Se considera terminado cuando la normalización de response de CCLE sigue la interpretación indicada de Amax como control positivo y sigue siendo válida para los archivos de entrada generados.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python
Área
data-engineering
Tipo de issue
Error
Dificultad
3/5
Tiempo estimado
1-2 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
45/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.