codestates / codestates/ds-TIL
[TIL] 오예은_201013
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
## 키워드
`다중선형회귀(Multi Linear Regression)` `train data vs. test data`
`과적합(overfitting) vs. 과소적합(underfitting)` `편향(bias) vs.분산(variance)`
## 배운 것
#### 다중회귀분석
- 단순회귀분석에서 특성을 추가하여 분석한 것
- cf. 다항회귀분석 : 1차원을 넘어 n차항의 특성을 가진 것, 직선이 아님 (하지만 결국 선형회귀로 볼 수 있다)
#### 결정계수(R^2)
- SSR: 예측값과 평균값의 차이 / SST: 실제값과 평균값의 차이 ->예측값이 평균과 얼마나 가까운지를 나타냄
- 1에 가까울 수록 설명력이 크다. 0이면 설명선이 mean값을 가진다고 할 수 있다.
- feature를 계속 늘려가다 보면 모델의 성능과 관계 없이 결정계수 값이 계속 올라갈 수 있다. 그래서 R^2를 보완하는 지표들이 있다.
#### 과적합 / 과소적합
- 과적합: 학습데이터에서는 잘 맞추지만 테스트 데이터에서는 잘 못맞춘다.
- low bias, low variance가 가장 이상적이지만, 현실적으로는 low bias, high variance 모델을 만드는 방향으로 진행될 일이 많을 것
-> 어떻게 하면 과적합을 줄일 수 있을지 고민하는 작업이 필요하다.
## 더 해볼 것
- 오차의 편향/분산 개념이 아직 정확히 안잡힌다. 예시가 있는지 더 찾아봐야겠다.
## 느낀점
- 선형회귀를 다루면서 계속 '미분' 얘기가 나오는데, 미분을 배워본적이 없어서 무슨 관련이 있는지는 모르겠지만 선형회귀분석과 밀접한 관련이 있는 것 같으니 주말에 대략적인 개념이라도 잡아야할 것 같다.
- 제일 적합한 특성을 적용한 모델을 찾는게 어려운 것 같다. 도메인지식이 충분하지 않다면 이것 저것 계속 넣어보고 실험해보는 방법밖엔 없을까? 오늘은 처음이라 일단 해보았지만 앞으로는 효율적인 방법을 찾아야 하지 않을까 하는 생각이 들었다.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.