codestates / codestates/ds-TIL

[TIL] 김민채_200924

Open
#389 0 comments 1 reaction 0 assignees View on GitHub
DSFT01
Dominant language
No language data
Stars
2
Forks
1
PR merge metrics
No merged PRs in 30d

Description

## Today I learn_19

**1. clustering**
- 데이터셋을 각 데이터간 유사점을 기준으로 그룹을 짓는 작업
- 이유는 간단하다. : 보통 주어진 데이터셋에 아무런 label도 없는 가운데 분석을 해야하는 상황이 있기 때문
- clustering을 하는 방법에는 여러 가지가 있으나 KMeans를 배웠다.
- 임의의 cluster 중심점을 설정한 후
'각 데이터와의 거리를 계산해' '가까운 것끼리' 새로운 cluster를 만든다.
- 새로워진 cluster를 가지고 중심점을 새로 설정한다.
- 새로 설정한 중심점과 각 데이터와의 거리를 계산하고 또다시 새로운 cluster를 만든다.
- 계속 반복해 더 이상 cluster가 변하지 않는 지점을 찾는다.
- 이것이 바로 주어진 데이터를 가장 유사하게 그룹지을 수 있는 label이 된다.

**2. Impression from today**
- 전반적인 설명은 알아듣고 왜 필요한지 대략 설명할 수 있지만
- function을 적용해서 해석하는게 어려웠다.
- 음... 아직 잘 안다고 할 수 없는거 같다.
- 과제가 역대급이라고 생각된다.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.