AlibabaResearch / AlibabaResearch/AdvancedLiterateMachinery

训练文档理解时日文文字转token时出现很多[UNK],如何解决

オープン
#214 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
C++
スター
1.8k
フォーク
195
PR マージ指標
30日以内にマージされた PR はありません

説明

加载默认tokenizer 进行字符转换时,会出现部分字符为【UNK】
TOKENIZER = TOKENIZER = BertTokenizer.from_pretrained("bert-base-uncased", do_lower_case=True)
tokenizer = TOKENIZER

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

評価

この issue はまだ評価されていません。

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。