selfteaching / selfteaching/selfteaching-python-camp

Day09 的中文分词大家是怎么实现的?

Offen
#778 1 Kommentar 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

question
Vorherrschende Sprache
Python
Sterne
151
Forks
875
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

今天作业的最后竟然是中文分词输出统计结果。我查了一下网上有说是直接调用一些工具,结巴,但是并不知道其中分词原理又怕后面涉及到不方便修改,就像自己写代码实现。一个思路就是与一个现有的词典文件比对分割,我找到了一个txt文件,不过他还是带有词汇解释的那种,不是单独的词汇,其他代码照着敲好了,但是现在应该是制作比对词典这里有点问题。大家怎么操作的,或者有没有方便使用的词组文件?

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Erste Schritte

  1. Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
  3. Forke das Repository und arbeite in einem Branch.
  4. Öffne einen Pull Request, der die Issue-Nummer nennt.

Rechercherichtung

Gehe vom bestehenden, im Issue erwähnten Code aus und untersuche das TXT-Wörterbuch mit Erklärungen zum Vokabular. Ermittle, wie das Wörterbuch die angeforderten Statistiken zur chinesischen Wortsegmentierung unterstützen sollte; abgeschlossen ist die Aufgabe mit einer funktionierenden wörterbuchbasierten Ausgabe, aber das Issue nennt keine Dateien oder Tests.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python
Bereich
data
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
20/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.