89artur / 89artur/predicting_cardiovascular_disease_risk
выводы при обучении модели
- Linguagem predominante
- Jupyter Notebook
- Estrelas
- 0
- Forks
- 0
- Métricas de merge de PRs
- Nenhum PR com merge em 30d
Descrição
Работа с тренировочными данными
1. Выбирали F2 меру метрику, которая учитывает метрики precision и recall одновременно, которой мы можем регулировать важность метрики precision и recall
2. f2 на тренировочных данных составила 0.73 (при BETA=2, акцент на RECALL), однако матрица ошибок показала, что 'погоня' за recall привела к тому, что recall= 1, все предсказание True, отсуствие False предсказаний, то есть на любой случай матрица предсказывает True.
**Такая модель МО не подходит**
так как низкий accuracy - 0,35, низкий precision - 0,35, f1 - 0.522 показывает что модель совсем не справляется с точностью предсказаний
так как модель подбиралась в автоматическом режиме, что говорит о том что это лучшие метрики, которые можно получить
,
Значит показатели метрик свидетельствует о дисбалансе классов, чтобы его устранить подберем порог классификации (по умолчанию порог классификации у моделей 0,5)
4. После подбора оптимального порога классификации, метрики немного улучшились (accuracy - 0,37, precision - 0,35, f1 - 0.525),
Также по наличию значений FN>0, 40 и FP 168 (по матрице ошибок) свидетельствует о том что модель ошибается, конкретно в нашем случае это хороший результат относительно ранее полученного (FN = 0 и FP =0 ), значит модель не всегда ставит True
**Согласно, метрикам и матрице ошибок, такую модель с таким порогом классификации можно считать оптимальной. **
Работа с валидационными данными
1. f2 мера (BETA=1) метрика на валидационных данных 0,532 близка к тренировочным данным 0,525, то есть модель подтверждает свою прогнозную силу
2. на валидационной выборке PRECISION = 37%, т.е. в 37% случаев модель смогла определить РСЗ (риск сердечных заболеваний) точность определений. 63% случаев ошибка первого рода, ложные срабатывания,
3. на валидационной выборке RECALL = 36%, т.е. в 36% случаев модель смогла определить РСЗ (полнота точных определений). 64% случаев ошибка второго рода, определены моделью здоров, когда был по факту больной,
4. **С одной стороны абсолютные значения метрики стоило бы увеличить, чтобы увеличить точность прогноза, с другой стороны была проделана работа по увеличению точности прогноза: удаление признаков 'Доход' 'Пол' подбор порога классификации и валидационный прогноз подтвердил работоспособность модели**
Guia de contribuição
Nenhum guia de contribuição indexado para este repositório
Avaliação
Esta issue ainda não foi avaliada.