InternLM / InternLM/xtuner

[Feature] 提前确认离线处理的 llava 数据所使用的 tokenizer 是否和当前配置中一致

Open
#484 0 comments 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
5.2k
Forks
448
Avg merge
3d 15h
Merged PRs (30d)
26

Description

在使用过程中发现,如果用户采用 internlm2 tokenizer 离线处理数据,下次实验时候换成了 vicuna 配置训练会出现越界错误。
该越界错误不容易 debug,出现错误原因就在于 tokenizer 不一样。因此有两个办法解决:

1. 在保存离线数据集时候,保存当前 tokenizer 信息,当训练时候发现不一致则告诉用户,这样可以避免后续错误(推荐方案)
2. 在文档中说明

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.