89artur / 89artur/predicting_cardiovascular_disease_risk

выводы при обучении модели

Open
#1 0 comments 0 reactions 0 assignees View on GitHub
enhancement
Dominant language
Jupyter Notebook
Stars
0
Forks
0
PR merge metrics
No merged PRs in 30d

Description

Работа с тренировочными данными
1. Выбирали F2 меру метрику, которая учитывает метрики precision и recall одновременно, которой мы можем регулировать важность метрики precision и recall
2. f2 на тренировочных данных составила 0.73 (при BETA=2, акцент на RECALL), однако матрица ошибок показала, что 'погоня' за recall привела к тому, что recall= 1, все предсказание True, отсуствие False предсказаний, то есть на любой случай матрица предсказывает True.
**Такая модель МО не подходит**
так как низкий accuracy - 0,35, низкий precision - 0,35, f1 - 0.522 показывает что модель совсем не справляется с точностью предсказаний

так как модель подбиралась в автоматическом режиме, что говорит о том что это лучшие метрики, которые можно получить
,
Значит показатели метрик свидетельствует о дисбалансе классов, чтобы его устранить подберем порог классификации (по умолчанию порог классификации у моделей 0,5)

4. После подбора оптимального порога классификации, метрики немного улучшились (accuracy - 0,37, precision - 0,35, f1 - 0.525),
Также по наличию значений FN>0, 40 и FP 168 (по матрице ошибок) свидетельствует о том что модель ошибается, конкретно в нашем случае это хороший результат относительно ранее полученного (FN = 0 и FP =0 ), значит модель не всегда ставит True

**Согласно, метрикам и матрице ошибок, такую модель с таким порогом классификации можно считать оптимальной. **

Работа с валидационными данными
1. f2 мера (BETA=1) метрика на валидационных данных 0,532 близка к тренировочным данным 0,525, то есть модель подтверждает свою прогнозную силу
2. на валидационной выборке PRECISION = 37%, т.е. в 37% случаев модель смогла определить РСЗ (риск сердечных заболеваний) точность определений. 63% случаев ошибка первого рода, ложные срабатывания,
3. на валидационной выборке RECALL = 36%, т.е. в 36% случаев модель смогла определить РСЗ (полнота точных определений). 64% случаев ошибка второго рода, определены моделью здоров, когда был по факту больной,
4. **С одной стороны абсолютные значения метрики стоило бы увеличить, чтобы увеличить точность прогноза, с другой стороны была проделана работа по увеличению точности прогноза: удаление признаков 'Доход' 'Пол' подбор порога классификации и валидационный прогноз подтвердил работоспособность модели**

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.