codestates / codestates/ds-TIL
[TIL] 오예은_201015
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
## 키워드
`검증(validatin) vs. 테스트(test) 데이터` `분류모델` `Logistic Regression`
## 배운 것
#### 학습(train) vs. 검증(validatin) vs. 테스트(test) 데이터
- train data: 모델의 학습(훈련)을 위한 데이터
- validation data: 모델의 오류를 예측하여 성능을 개선하는데 사용
- test data: 제대로된 성능이 나오는지 최종 체크용
(test data로 예측한 후 수정해 또 test data로 예측하면 과적합이 생길 수 있음)
- train_test_split 을 사용해 랜덤값으로 train, test데이터 나눔
- 마지막 모델을 배포할때는 test data까지 적용하여 모델을 수정 후 배포
#### Logistic Regression
- 분류문제에서는 훈련 데이터에서 가장 빈번하게 나타나는 클래스가 기준모델
- 평가지표로 정확도(Accuracy) 사용
- odds(실패확률에 대한 성공확률의 비율)를 이용하여 관측치가 특정 클래스에 속할 확률값을 계산
## 더 해볼 것
- 로지스틱회귀 개념 정리하기
- 회귀분석 평가지표 비교해보기
- 원-핫 인코딩(사이킷런) 문서 정독
## 느낀점
- 어제는 하다가 계속 막히고 막히고 했는데, 오늘은 강의 코드를 붙여가면서 어찌저찌 흐름은 따라갈 수 있었다.
어제 과제를 지금 보면 조금 덜 막막할 것 같다고 생각은 드는데 잘 모르겠다. 그래도 반복하니 용어에 익숙해지는 것 같다.
Contributor guide
No contributing guide indexed for this repository
Research direction
The issue contains a Korean TIL entry about train, validation, and test data, Logistic Regression, and scikit-learn concepts, but names no file, test, or entry point. Start by identifying the repository's expected location and format for TIL documentation; completion cannot be determined until a specific documentation change is defined.
Written by the indexing model from the issue text.
Assessment
- Tech stack
- scikit-learn
- Domain
- documentation, machine-learning
- Issue type
- Documentation
- Difficulty
- 1/5
- Estimated time
- Under an hour
- Activity status
- Stale
- Clarity
- Needs clarification
- Newbie friendliness
- 20/100