codestates / codestates/ds-TIL
[TIL] 김민채_201216
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
### Today I Learn_72
**1. document classification : 핵심 = SVD --> LSA**
- dtm 형태의 corpus 는 이상치라고 볼 수 있는 것마저 포함되어 있기 때문에 바로 모델링하기에는 지나친 비용이 든다.
- 따라서 보다 효율이 좋은 모델은 만들어내기 위해, dtm 역시 보다 model scoring에 미미한 영향력을 끼치는 column을
제거해 차원을 줄일 필요가 있다.
- dtm의 차원이 줄어든다는 것은 분석에 사용될 term을 줄여 보다 일반화된 모델을 만드는데 도움이 된다.
- 전체 문서의 수를 문서당 존재하는 단어의 수를 가지고 나눈 값이 1500보다 작은 경우
TF-IDF의 N-gram을 사용해 벡터화 하고, 모델링 작업에 들어가면 된다.
- 무작정 column을 없애는게 아니라 SVD로 쪼갠 행렬 가운데
특이벡터행렬의 특이값 중 가장 큰 값을 제외한 나머지를 제거하기에 생각보다 차원의 수를 많이 줄이더라도
model scoring 결과가 굉장히 좋다.
**2. Impression from Today**
- 어제 즐거웠던 강의에 비해(이해돼서 즐거웠다) 과제는 막상 잘 안 되어서 스트레스를 많이 받았는데
- 오늘은 수업 자체는 너무 어렵다고 생각되었는데 생각보다 note를 돌려보면서 이해해보니
데이터를 가지고 선형대수학 자체를 검증하는 부분 외엔 이해가 잘 되어서 의외였다.(역시 새옹지마인가..)
- 어제 배운 것과 오늘 배운 것을 함께 보면서 과제하면 그래도 좀 정리가 더 될 것만 같은데
또 모르겠다. ㅎ
- 분명 조금씩 배운 것이 쌓여가곤 있는거 같은데 내 욕심만큼 되진 않으니 한번 씩 요상하게 스트레스를 많이 받는데.
그냥 이 상황을 피할 수 없단걸 이제 4개월이 되어가니 그만 받아들이자.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.