89artur / 89artur/predicting_cardiovascular_disease_risk

выводы при обучении модели

Abierto
#1 0 comentarios 0 reacciones 0 asignados Ver en GitHub
enhancement
Lenguaje dominante
Jupyter Notebook
Estrellas
0
Forks
0
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

Работа с тренировочными данными
1. Выбирали F2 меру метрику, которая учитывает метрики precision и recall одновременно, которой мы можем регулировать важность метрики precision и recall
2. f2 на тренировочных данных составила 0.73 (при BETA=2, акцент на RECALL), однако матрица ошибок показала, что 'погоня' за recall привела к тому, что recall= 1, все предсказание True, отсуствие False предсказаний, то есть на любой случай матрица предсказывает True.
**Такая модель МО не подходит**
так как низкий accuracy - 0,35, низкий precision - 0,35, f1 - 0.522 показывает что модель совсем не справляется с точностью предсказаний

так как модель подбиралась в автоматическом режиме, что говорит о том что это лучшие метрики, которые можно получить
,
Значит показатели метрик свидетельствует о дисбалансе классов, чтобы его устранить подберем порог классификации (по умолчанию порог классификации у моделей 0,5)

4. После подбора оптимального порога классификации, метрики немного улучшились (accuracy - 0,37, precision - 0,35, f1 - 0.525),
Также по наличию значений FN>0, 40 и FP 168 (по матрице ошибок) свидетельствует о том что модель ошибается, конкретно в нашем случае это хороший результат относительно ранее полученного (FN = 0 и FP =0 ), значит модель не всегда ставит True

**Согласно, метрикам и матрице ошибок, такую модель с таким порогом классификации можно считать оптимальной. **

Работа с валидационными данными
1. f2 мера (BETA=1) метрика на валидационных данных 0,532 близка к тренировочным данным 0,525, то есть модель подтверждает свою прогнозную силу
2. на валидационной выборке PRECISION = 37%, т.е. в 37% случаев модель смогла определить РСЗ (риск сердечных заболеваний) точность определений. 63% случаев ошибка первого рода, ложные срабатывания,
3. на валидационной выборке RECALL = 36%, т.е. в 36% случаев модель смогла определить РСЗ (полнота точных определений). 64% случаев ошибка второго рода, определены моделью здоров, когда был по факту больной,
4. **С одной стороны абсолютные значения метрики стоило бы увеличить, чтобы увеличить точность прогноза, с другой стороны была проделана работа по увеличению точности прогноза: удаление признаков 'Доход' 'Пол' подбор порога классификации и валидационный прогноз подтвердил работоспособность модели**

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Evaluación

Este issue todavía no se ha evaluado.

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.