codestates / codestates/ds-TIL

[TIL] 오예은_201217

Open
#1,201 0 comments 0 reactions 0 assignees View on GitHub
DSFT01
Dominant language
No language data
Stars
2
Forks
1
PR merge metrics
No merged PRs in 30d

Description

## 키워드
`Topic Modeling` `LDA` `Gensim` `gibbs sampling`

## 배운 것
- LDA(Latent Dirchilet Allocation Models; 잠재 디리클레 할당 모델)
: 문서를 토픽(주제)별로 구분하기 위한 모델. 베이지안 네트워크 활용(사전분포개념).
토픽에 나타나는 단어 + 문서에 나타나는 토픽의 단어 => 어떤 Topic일 가능성을 가지고 문서를 분류
- 깁스 샘플링(Gibbs sampling)
: 문서 내 토픽의 개수, 토픽에 존재하는 단어의 수를 가지고 확률계산에 사용

## 느낀 점
- 실제로 쓰이는 데이터를 주제별로 분류하는 과정이 재미있었다.
- 예상대로 LDA에서 토픽을 정하는 과정에 시간 소요가 많이 되었다. 스프린트 챌린지에 이 내용이 나오면 시간 배분을 잘 해야할 것 같다.
- 공부를 하면 할 수록 NLP에 정말 다양한 이론과 개념들이 있고, 공부할만한 것들이 무궁 무진하다는 것이 느껴졌다.
수학적 지식이 있었으면 더 재밌었을 것 같다는 생각이 들었지만 일단 지금은 주어진 자료를 소화하는 데 초점을 맞추고 나중에 조금 여유가 생기면 NLP와 관련된 다양한 라이브러리를 경험해보겠다고 결론을 지었다.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.