codestates / codestates/ds-TIL
[TIL] 송지_201214
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
:warning: 해당 템플릿은 기본 예시입니다. 수강생 여러분의 방식에 맞춰 **자유롭게** 작성해주시길 바랍니다 :warning:
:no_entry_sign: **과제 솔루션 공유 절대 금지** :no_entry_sign:
- **키워드**: NLP, tokenization, stopwords, lemmatization, stemming, spacy라이브러리
- **배운 것**:
1. NLP(자연어처리)의 텍스트 토큰화에서 사용하는 용어 - 코퍼스, 토큰화, 불용어
2. 올바른 토큰화의 조건 - LIST나 GENERATOR에 저장되어야 한다, 가능하면 문자를 대문자 or 소문자로 통일
3. 정규식을 사용하여 토큰화하기 - 문장 부호, 공백 등 제거
4. 주피터 사용
5. NLTK : 영어 코퍼스를 토큰화하기 위한 도구들을 제공
6. spacy 라이브러리
- **어려웠던 부분**: 처음에 토큰의 개념이 안잡혀서 헷갈렸다.
- **더 알고 싶은 부분 / 공부하고 싶은 부분**: 더 알면 좋겠는데 과제부터..
- **느낀 점**: 분석하는 느낌나서 완전 재밌다. 나는 뭔가 아이디어가 필요한 것 보단 있는걸 어떻게 하면 효율적으로 만들까 생각하게 하는 이슈에 재미를 느낀다.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.