graykode / graykode/nlp-tutorial

BERT存在两个严重问题

未关闭
#86 2 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
主要语言
Jupyter Notebook
星标
14.9k
派生
3.9k
PR 合并指标
30 天内没有已合并 PR

描述

1.随机替换成词表中的其他词时应该排除[PAD],[CLS],[SEP],[MASK],否则预测模型会学会预测这些词。
2.学习率开大了,始终难以收敛,开1e-6很合适。

贡献指南

打开贡献指南

调研方向

该 issue 指出了 BERT 的随机 token 替换和学习率设置,但未指定文件或测试。首先定位 BERT 训练 notebook 以及 token 替换和 optimizer 配置;完成标准是排除特殊 token 的替换、学习率为 1e-6,并检查训练行为。

由索引模型根据 Issue 内容生成。

评估

技术栈
jupyter-notebook
领域
machine-learning
Issue 类型
缺陷
难度
3/5
预计耗时
1-2 天
活跃度
停滞
描述清晰度
基本清楚
新手友好度
35/100

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。