AlibabaResearch / AlibabaResearch/AdvancedLiterateMachinery
训练文档理解时日文文字转token时出现很多[UNK],如何解决
Offen
- Vorherrschende Sprache
- C++
- Sterne
- 1.8k
- Forks
- 195
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
加载默认tokenizer 进行字符转换时,会出现部分字符为【UNK】
TOKENIZER = TOKENIZER = BertTokenizer.from_pretrained("bert-base-uncased", do_lower_case=True)
tokenizer = TOKENIZER
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Bewertung
Dieses Issue wurde noch nicht bewertet.