codestates / codestates/ds-TIL
[TIL]김현재 201215
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
- **키워드**:
> Bag-of-Word, Word2Vec
> vectorization, tf-idf, K-NN(NearestNeighbors모델), cosine_similarity
- **배운 것**:
> 문장을 벡터화하는 법(Bag-of-Word) : sklearn.feature_extraction.text.CountVectorizer / sklearn.feature_extraction.text.TfidfVectorizer 사용
> 장점: 단순한 모델이라 빠름. / 단점: 단어들간의 관계는 고려하지 못함.
> 단어를 벡터화하는 법(Word2Vec) : sklearn.neighbors.NearestNeighbors 사용.
> 장점: 문맥도 고려하여 학습 후 레이블해준다는 장점. / 단점: cpu성능이 좋아야 ..?
- **어려웠던 부분**:
> n-gram 등 하이퍼파라미터 조정하는 것 아직 완전히 이해 못했음.
> 코사인 유사도를 개념적으로 이해는 했으나 직접 해보는 것까지는 못해봄.
> PCA 벡터 시각화, 직접 해보는 것까지는 못해봄.
- **더 알고 싶은 부분 / 공부하고 싶은 부분**:
> 사례로 K-NN 모델을 더 활용해보고 싶음.
- **느낀 점**:
> 오늘도 삽질을 하였지만, 결국 잘 헤쳐나갈 수 있어서 다행이었음.
> 과제할 때 적용하는 과정은 힘들었지만, 분석된 결과를 해석해보는 부분에서 재미가 있었음.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.