InternLM / InternLM/Agent-FLAN
想请教一些关于训练的事情
Open
- Dominant language
- No language data
- Stars
- 362
- Forks
- 10
- PR merge metrics
- No merged PRs in 30d
Description
1. 文章中说"对于Agent-FLAN实验,我们遵循AgentTuning中的做法,将ShareGPT和Agent语料库以1:1的混合比例混合进行训练。"

我注意到你们给出了数据集,想请教一下你们数据量和配比是什么呢?(包括flan版本和你们复现的agenttuning版本)(shareGPT应该就90000多条吧,你们是把这几个怎么混合(or过采样)到一样的呢?)
2.想在了解一下超参数的问题,因为我看agenttuning有一些非常奇怪的超参数,您这里是直接使用deepspeed默认的超参数吗?(for example 10%的warmup,最大token是2048还是4096之类的)
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.