AlibabaResearch / AlibabaResearch/AdvancedLiterateMachinery

训练文档理解时日文文字转token时出现很多[UNK],如何解决

Open
#214 0 comments 0 reactions 0 assignees View on GitHub
Dominant language
C++
Stars
1.8k
Forks
195
PR merge metrics
No merged PRs in 30d

Description

加载默认tokenizer 进行字符转换时,会出现部分字符为【UNK】
TOKENIZER = TOKENIZER = BertTokenizer.from_pretrained("bert-base-uncased", do_lower_case=True)
tokenizer = TOKENIZER

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.