selfteaching / selfteaching/selfteaching-python-camp
Day09 的中文分词大家是怎么实现的?
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Python
- Sterne
- 151
- Forks
- 875
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
今天作业的最后竟然是中文分词输出统计结果。我查了一下网上有说是直接调用一些工具,结巴,但是并不知道其中分词原理又怕后面涉及到不方便修改,就像自己写代码实现。一个思路就是与一个现有的词典文件比对分割,我找到了一个txt文件,不过他还是带有词汇解释的那种,不是单独的词汇,其他代码照着敲好了,但是现在应该是制作比对词典这里有点问题。大家怎么操作的,或者有没有方便使用的词组文件?
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Gehe vom bestehenden, im Issue erwähnten Code aus und untersuche das TXT-Wörterbuch mit Erklärungen zum Vokabular. Ermittle, wie das Wörterbuch die angeforderten Statistiken zur chinesischen Wortsegmentierung unterstützen sollte; abgeschlossen ist die Aufgabe mit einer funktionierenden wörterbuchbasierten Ausgabe, aber das Issue nennt keine Dateien oder Tests.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- data
- Issue-Typ
- Feature
- Schwierigkeit
- 5/5
- Geschätzter Aufwand
- Über eine Woche
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 20/100