deepspeedai / deepspeedai/DeepSpeedExamples
ds_eval_config v.s. ds_config
未关闭
还没有人认领这个 Issue。
- 主要语言
- Python
- 星标
- 6.8k
- 派生
- 1.1k
- 平均合并
- 2 天 16 小时
- 30 天内合并 PR
- 1
描述
when initializing reward and ref models in step 3 of deepspeed-chat, there are two kinds of deepspeed config files are used, i.e. ds_config and ds_eval_config. May I ask why we need to use two configs here and any suggestions on safely removing ds_eval_config? e.g.,
def _init_reward(self, critic_model_name_or_path):
stime = log_init("Reward")
# DS Config
zero_stage = self.args.critic_zero_stage
if zero_stage != 3:
# If critic is ZeRO-3 then we use it for everything, otherwise assume we have enough memory
zero_stage = 0
ds_config = get_eval_ds_config(offload=self.args.offload,
stage=zero_stage)
ds_config[
'train_micro_batch_size_per_gpu'] = self.args.per_device_mini_train_batch_size
ds_config[
'train_batch_size'] = self.args.per_device_mini_train_batch_size * torch.distributed.get_world_size(
) * self.args.gradient_accumulation_steps
#TODO(jeff): should not be needed, we should be able to use ds_config above
#TODO(jeff): it means we never create the critic w. zero.init context if we are using ZeRO-3
ds_eval_config = get_eval_ds_config(offload=False, stage=0)
# Model
reward_model = create_critic_model(
model_name_or_path=critic_model_name_or_path,
tokenizer=self.tokenizer,
ds_config=ds_eval_config,
num_padding_at_beginning=self.args.num_padding_at_beginning,
rlhf_training=True)
reward_engine, *_ = deepspeed.initialize(model=reward_model,
config=ds_config)
贡献指南
这个仓库没有索引到贡献指南
从这里开始
- 先读完整个 Issue,再读项目的贡献指南。
- 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
- Fork 仓库,在一个分支上完成修改。
- 提交 Pull Request,并在描述里引用这个 Issue 编号。
调研方向
从第 3 步的 deepspeed-chat 流程中的 _init_reward 开始,跟踪 get_eval_ds_config、create_critic_model 和 deepspeed.initialize。比较 ds_config 和 ds_eval_config 的作用,然后验证移除第二个配置是否能保留奖励模型初始化和 ZeRO 行为。
由索引模型根据 Issue 内容生成。
评估
- 技术栈
- python
- 领域
- machine-learning
- Issue 类型
- 重构
- 难度
- 4/5
- 预计耗时
- 3-5 天
- 活跃度
- 停滞
- 描述清晰度
- 基本清楚
- 新手友好度
- 35/100