codestates / codestates/ds-TIL

[TIL]윤현태 201217

Open
#1,203 0 comments 0 reactions 0 assignees View on GitHub
DSFT01
Dominant language
No language data
Stars
2
Forks
1
PR merge metrics
No merged PRs in 30d

Description

어제 계속해서 공부하다가 까먹고 TIL을 하지 못했는데, 이번 섹션은 특히 이해하는게 어렵다. 그래도 어제 간신히 SVD를 이해해서 다행이고, 오늘은 topic modeling이라는 굉장히 신박한 방식을 배웠다. LDA라는 방식이 바로 그것이다.
인간은 글을 개념으로 이해하지만, 기계가 글을 이해하려면(?) topic이 있어야 하고, 한 문장은 여러개의 topic으로 이루어져 있다. 그리고 한 topic은 여러개의 단어들로 구성되어 있다. 그리고 우리가 추론하고자 하는 것은
𝑃(전체토픽비율,문서의토픽비율,단어의토픽비율|𝐷) 이 된다.
그리고 LDA는
1. 모델 부분 , 2. 추론 부분으로 나누어져 있는데,

모델 부문에서 눈여겨 보아야 할 것은 알파 값과 베타 값이다.
알파 값은 문서의 토픽 분포를 결정하고, 베타는 토픽의 단어 분포를 결정하는데, 정확하게 LDA의 개념과 동일한 파라미터들이어서 이것들을 잘 조율해야 최상의 결과를 얻을 수 있다. 일단 이해한것은 여기까지인데, 더 알아봐야 겠다.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.