codestates / codestates/ds-blog

[윤형준] 분류문제에서의 보아야할 metric (작성중)

Open
#208 1 comment 0 reactions 0 assignees View on GitHub
Dominant language
No language data
Stars
2
Forks
4
PR merge metrics
No merged PRs in 30d

Description

아래와 같이 positive는 pos, 그리고 positive predicted는 pos_prime으로 표현하겠습니다.
| Group 1 | Group 2 |
| ------------- | ------------- |
| Positive | pos |
| Negative | neg |
| Positive_predicted | pos_prime |
| Negative_predicted | neg_prime |

f1 score에는 positive에 해당되는 값이 있고 negative에 해당되는 값이 있습니다.

**f1의 식은 다음과 같습니다.**
f1(pos) = harmonic_mean( precision(pos) , recall(pos) )
f1(neg) = harmonic_mean( precision(neg) , recall(neg) )

우선 f1(pos) 와 f1(neg)를 동시에 올리기 위해선 성능이 더 좋은 (즉 분류를 더 잘하는) 모델을 사용해야됩니다.

우리가 모델이 logistic regression, decision tree, 그리고 random forest를 가지고 비교한다고 가정했을때 예를 들어 random forest가 가장 성능이 좋다고 가정해 보겠습니다.

다른 두가지 모델에 비해서 random forest가 f1(pos) 그리고 f1(neg)를 가장 높게 도출한다고 가정하겠습니다.

그러면 여기서 우리가 모델을 random forest로 정했습니다. 여기서 우리가 threshold를 조정하면 f1(pos)와 f1(neg)중에 하나는 올라가고 하나는 내려갑니다. Trade off 현상이 일어납니다.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.