89artur / 89artur/predicting_cardiovascular_disease_risk

выводы при обучении модели

Aberta
#1 0 comentários 0 reações 0 responsáveis Ver no GitHub
enhancement
Linguagem predominante
Jupyter Notebook
Estrelas
0
Forks
0
Métricas de merge de PRs
Nenhum PR com merge em 30d

Descrição

Работа с тренировочными данными
1. Выбирали F2 меру метрику, которая учитывает метрики precision и recall одновременно, которой мы можем регулировать важность метрики precision и recall
2. f2 на тренировочных данных составила 0.73 (при BETA=2, акцент на RECALL), однако матрица ошибок показала, что 'погоня' за recall привела к тому, что recall= 1, все предсказание True, отсуствие False предсказаний, то есть на любой случай матрица предсказывает True.
**Такая модель МО не подходит**
так как низкий accuracy - 0,35, низкий precision - 0,35, f1 - 0.522 показывает что модель совсем не справляется с точностью предсказаний

так как модель подбиралась в автоматическом режиме, что говорит о том что это лучшие метрики, которые можно получить
,
Значит показатели метрик свидетельствует о дисбалансе классов, чтобы его устранить подберем порог классификации (по умолчанию порог классификации у моделей 0,5)

4. После подбора оптимального порога классификации, метрики немного улучшились (accuracy - 0,37, precision - 0,35, f1 - 0.525),
Также по наличию значений FN>0, 40 и FP 168 (по матрице ошибок) свидетельствует о том что модель ошибается, конкретно в нашем случае это хороший результат относительно ранее полученного (FN = 0 и FP =0 ), значит модель не всегда ставит True

**Согласно, метрикам и матрице ошибок, такую модель с таким порогом классификации можно считать оптимальной. **

Работа с валидационными данными
1. f2 мера (BETA=1) метрика на валидационных данных 0,532 близка к тренировочным данным 0,525, то есть модель подтверждает свою прогнозную силу
2. на валидационной выборке PRECISION = 37%, т.е. в 37% случаев модель смогла определить РСЗ (риск сердечных заболеваний) точность определений. 63% случаев ошибка первого рода, ложные срабатывания,
3. на валидационной выборке RECALL = 36%, т.е. в 36% случаев модель смогла определить РСЗ (полнота точных определений). 64% случаев ошибка второго рода, определены моделью здоров, когда был по факту больной,
4. **С одной стороны абсолютные значения метрики стоило бы увеличить, чтобы увеличить точность прогноза, с другой стороны была проделана работа по увеличению точности прогноза: удаление признаков 'Доход' 'Пол' подбор порога классификации и валидационный прогноз подтвердил работоспособность модели**

Guia de contribuição

Nenhum guia de contribuição indexado para este repositório

Avaliação

Esta issue ainda não foi avaliada.

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.