codestates / codestates/ds-TIL
[TIL] 오예은_201217
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
## 키워드
`Topic Modeling` `LDA` `Gensim` `gibbs sampling`
## 배운 것
- LDA(Latent Dirchilet Allocation Models; 잠재 디리클레 할당 모델)
: 문서를 토픽(주제)별로 구분하기 위한 모델. 베이지안 네트워크 활용(사전분포개념).
토픽에 나타나는 단어 + 문서에 나타나는 토픽의 단어 => 어떤 Topic일 가능성을 가지고 문서를 분류
- 깁스 샘플링(Gibbs sampling)
: 문서 내 토픽의 개수, 토픽에 존재하는 단어의 수를 가지고 확률계산에 사용
## 느낀 점
- 실제로 쓰이는 데이터를 주제별로 분류하는 과정이 재미있었다.
- 예상대로 LDA에서 토픽을 정하는 과정에 시간 소요가 많이 되었다. 스프린트 챌린지에 이 내용이 나오면 시간 배분을 잘 해야할 것 같다.
- 공부를 하면 할 수록 NLP에 정말 다양한 이론과 개념들이 있고, 공부할만한 것들이 무궁 무진하다는 것이 느껴졌다.
수학적 지식이 있었으면 더 재밌었을 것 같다는 생각이 들었지만 일단 지금은 주어진 자료를 소화하는 데 초점을 맞추고 나중에 조금 여유가 생기면 NLP와 관련된 다양한 라이브러리를 경험해보겠다고 결론을 지었다.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.