codestates / codestates/ds-TIL

[TIL]김현재 201215

Open
#1,181 0 comments 0 reactions 0 assignees View on GitHub
DSFT01
Dominant language
No language data
Stars
2
Forks
1
PR merge metrics
No merged PRs in 30d

Description

- **키워드**:
> Bag-of-Word, Word2Vec
> vectorization, tf-idf, K-NN(NearestNeighbors모델), cosine_similarity

- **배운 것**:
> 문장을 벡터화하는 법(Bag-of-Word) : sklearn.feature_extraction.text.CountVectorizer / sklearn.feature_extraction.text.TfidfVectorizer 사용
> 장점: 단순한 모델이라 빠름. / 단점: 단어들간의 관계는 고려하지 못함.

> 단어를 벡터화하는 법(Word2Vec) : sklearn.neighbors.NearestNeighbors 사용.
> 장점: 문맥도 고려하여 학습 후 레이블해준다는 장점. / 단점: cpu성능이 좋아야 ..?

- **어려웠던 부분**:
> n-gram 등 하이퍼파라미터 조정하는 것 아직 완전히 이해 못했음.
> 코사인 유사도를 개념적으로 이해는 했으나 직접 해보는 것까지는 못해봄.
> PCA 벡터 시각화, 직접 해보는 것까지는 못해봄.

- **더 알고 싶은 부분 / 공부하고 싶은 부분**:
> 사례로 K-NN 모델을 더 활용해보고 싶음.

- **느낀 점**:
> 오늘도 삽질을 하였지만, 결국 잘 헤쳐나갈 수 있어서 다행이었음.
> 과제할 때 적용하는 과정은 힘들었지만, 분석된 결과를 해석해보는 부분에서 재미가 있었음.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.