codestates / codestates/ds-TIL

[TIL] day38 오세광 201028

Open
#722 0 comments 0 reactions 0 assignees View on GitHub
DSFT01
Dominant language
No language data
Stars
2
Forks
1
PR merge metrics
No merged PRs in 30d

Description

# 키워드: Premutation Importance, boosting, tennisdata

# (Act)What you actually did.
1. 순열중요도(Permutation Importance, Mean decrease Accuracy, MDA)를 배웠다.
2. 그래디언트 부스팅 모델을 배웠다.
3. 테니스 데이터가 왜 예측모델을 만들기 어려운지 배웠다.

# (Evaluate)How you evaluate your action's outcome vs. the initial goal(plan).
1. 순열중요도는 자신이 관심있는 특성을 무작위로 뽑아서 특성을 무력화 시킨다음, 이미 학습된 모델에서 성능에 어떤 영향을 미치는지 확인해볼 수 있는 방법이다.

특성의 중요도를 알아보는 방법 중에 따로 모델을 재학습시킬 필요가 없는 것에서 이점이 있다는 걸 알 수 있었다.

2. 그래디언트 부스팅모델은 랜덤포레스트와는 다른 예측모델임을 알 수 있었다.

하이퍼 파라미터를 잘 조절 할 수 있다면 랜덤포레스트보다 더 좋은 성능의 모델을 만들 수 있음을 알 수 있었다. 그 이유는 가장 큰 차이점인 각 트리가 독립적으로 만들어지는지, 이전에 만들어진 트리에 영향을 받는지에 따라 다르다는 것을 알 수 있었다.

3. 테니스 데이터를 예측 모델로 만들기 어려운 이유를 알 수 있었다.
핵심은 테니스 데이터의 경우 이미 결과를 알고 있는 통계적 데이터라는 것이다.
그래서 train 데이터로써 학습시키고 검증을 할 수 있을 것이다. 그런데 test 데이터로 성능을 체크하기에 쉽지 않는 난관이 있다. 결과가 나지 않은 테니스 데이터를 구해야 하는데, 경기 중간중간에 실시간으로 생겨나는 데이터가 바로 이런 데이터 이기 때문이다. 현재로서는 이런 데이터를 구하기 어렵다고 판단되어서, 테니스 데이터로 예측모델을 만드는 작업은 잠시 중지하기로 하였다.

# (Reflect)
How you worked throughout the stages plan-research-act-observe-evaluate.
What did you do well, what can you improve upon.
How can you improve your process?

새로운 데이터를 찾을 예정이다.

공부해야할 내용들
1. List comprehensive
2. Classification_report 사용법
3. Pred 만들기
4. 시각화 부분 쭉 정리

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.