MIT-LCP / MIT-LCP/mimic-code

Missing social history makes automated medical coding challenging

Ouverte
#1,663 1 commentaire 1 réaction 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Langage dominant
Jupyter Notebook
Étoiles
3.4k
Forks
1.7k
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

Prerequisites
Description

Automated medical coding (also called medical code prediction) is a growing machine learning task that aims to predict medical codes given a discharge summary. MIMIC-IV has become a popular dataset to train and evaluate such models. However, there is an issue. Since your de-identification algorithm removed the social history section, certain annotated medical codes are impossible to predict. For instance, the medical codes representing whether the patient smokes (e.g., F17.210 and Z87.891) are often annotated in MIMIC-IV without being mentioned in the discharge summary. This is because of the missing social history.

The consequences of the missing section are that the models are trained on labels that are impossible to predict and are evaluated unfairly every time the necessary information would have been in the social history. Consequently, MIMIC-IV is a noisier dataset for automated medical coding than MIMIC-III (MIMIC-III contains the social history).

Is there a way to de-identify the discharge summaries without removing the social histories?

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Piste de recherche

Commencez par consulter la documentation en ligne de MIMIC-IV ainsi que les exemples de l’issue concernant les antécédents sociaux manquants et les codes concernés. Déterminez si les résumés de sortie peuvent conserver les antécédents sociaux tout en respectant les exigences de désidentification ; considérer la tâche comme terminée nécessiterait une approche documentée et validée, plutôt qu’une petite modification du dépôt.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
machine-learning
Domaine
data, machine-learning
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
20/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.