[Feature] 提前确认离线处理的 llava 数据所使用的 tokenizer 是否和当前配置中一致
Open
- Dominant language
- Python
- Stars
- 5.2k
- Forks
- 448
- Avg merge
- 3d 15h
- Merged PRs (30d)
- 26
Description
在使用过程中发现,如果用户采用 internlm2 tokenizer 离线处理数据,下次实验时候换成了 vicuna 配置训练会出现越界错误。
该越界错误不容易 debug,出现错误原因就在于 tokenizer 不一样。因此有两个办法解决:
1. 在保存离线数据集时候,保存当前 tokenizer 信息,当训练时候发现不一致则告诉用户,这样可以避免后续错误(推荐方案)
2. 在文档中说明
Contributor guide
Assessment
This issue has not been assessed yet.