graykode / graykode/khuthon2018

데이터 크롤링 및 분석(딥러닝) 방안

Open
#3 5 comments 0 reactions 4 assignees Claimed by @stevejhkang View on GitHub
Dominant language
JavaScript
Stars
9
Forks
3
PR merge metrics
No merged PRs in 30d

Description

## 어떻게 데이터를 분석할 것인가?
문장에 따른 긍정/부정도 분석 (Korean Sentiment Analyzer)에 대해서 찾아본 결과 이전에 파이콘2015에서 진행했던 [영화 리뷰 별점에 따른 긍정/부정도 분석](https://www.pycon.kr/2015/program/36)에 대한 발표를 읽어보면 별점과 문장에서 사용된 형태소를 가지고 긍정/부정도를 평가합니다.
핵심은 **별점이 높은 단어들은 긍정적이고 낮은 단어들은 부정적이다**라고 학습시키는 겁니다.

## 모델링 방법
[여기](https://www.slideshare.net/langley0/textcnn-sentiment)에 나와있는데로 Kim Yoon의 Convolutional Neural Network for Sentence Classification 의 모델를 참고하겠습니다. 더불어 데이터 모델링 및 딥러닝에 관련해서는 새로운 이슈를 만들겠습니다.

## 시각화하기 위해 데이터를 어떻게 저장할 것인가?
[KoNLPy](http://konlpy.org/ko/latest/)를 사용하여 빈도수 별로 형태소를 저장.

## 참고 레퍼런스
- [Text-CNN1](https://www.slideshare.net/langley0/textcnn-sentiment)
- [Text-CNN2](https://ratsgo.github.io/natural%20language%20processing/2017/03/19/CNN/)
- [Yoon Kim 2014](http://emnlp2014.org/papers/pdf/EMNLP2014181.pdf)
- [Tensorflow with text-cnn](http://www.wildml.com/2015/12/implementing-a-cnn-for-text-classification-in-tensorflow/)
- [영화 리뷰 관련 깃허브](https://github.com/e9t/nsmc/)
- [한국어 형태소 분석 오픈소스](http://konlpy.org/ko/latest/)
- [파이콘 발표자료](https://www.lucypark.kr/docs/2015-pyconkr/#39)
- [그냥 읽어볼만한 깃허브](https://github.com/hoho0443/classify_comment_emotion)
- [로지스틱 회귀를 사용한 한국어 감성 분류](https://github.com/carpedm20/reviewduk)

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.