codestates / codestates/ds-TIL
[TIL] 김민채_200924
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
## Today I learn_19
**1. clustering**
- 데이터셋을 각 데이터간 유사점을 기준으로 그룹을 짓는 작업
- 이유는 간단하다. : 보통 주어진 데이터셋에 아무런 label도 없는 가운데 분석을 해야하는 상황이 있기 때문
- clustering을 하는 방법에는 여러 가지가 있으나 KMeans를 배웠다.
- 임의의 cluster 중심점을 설정한 후
'각 데이터와의 거리를 계산해' '가까운 것끼리' 새로운 cluster를 만든다.
- 새로워진 cluster를 가지고 중심점을 새로 설정한다.
- 새로 설정한 중심점과 각 데이터와의 거리를 계산하고 또다시 새로운 cluster를 만든다.
- 계속 반복해 더 이상 cluster가 변하지 않는 지점을 찾는다.
- 이것이 바로 주어진 데이터를 가장 유사하게 그룹지을 수 있는 label이 된다.
**2. Impression from today**
- 전반적인 설명은 알아듣고 왜 필요한지 대략 설명할 수 있지만
- function을 적용해서 해석하는게 어려웠다.
- 음... 아직 잘 안다고 할 수 없는거 같다.
- 과제가 역대급이라고 생각된다.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.