deepspeedai / deepspeedai/DeepSpeedExamples
ds_eval_config v.s. ds_config
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 6.8k
- Forks
- 1.1k
- Merge moyen
- 2 j 16 h
- PR mergées (30 j)
- 1
Description
when initializing reward and ref models in step 3 of deepspeed-chat, there are two kinds of deepspeed config files are used, i.e. ds_config and ds_eval_config. May I ask why we need to use two configs here and any suggestions on safely removing ds_eval_config? e.g.,
def _init_reward(self, critic_model_name_or_path):
stime = log_init("Reward")
# DS Config
zero_stage = self.args.critic_zero_stage
if zero_stage != 3:
# If critic is ZeRO-3 then we use it for everything, otherwise assume we have enough memory
zero_stage = 0
ds_config = get_eval_ds_config(offload=self.args.offload,
stage=zero_stage)
ds_config[
'train_micro_batch_size_per_gpu'] = self.args.per_device_mini_train_batch_size
ds_config[
'train_batch_size'] = self.args.per_device_mini_train_batch_size * torch.distributed.get_world_size(
) * self.args.gradient_accumulation_steps
#TODO(jeff): should not be needed, we should be able to use ds_config above
#TODO(jeff): it means we never create the critic w. zero.init context if we are using ZeRO-3
ds_eval_config = get_eval_ds_config(offload=False, stage=0)
# Model
reward_model = create_critic_model(
model_name_or_path=critic_model_name_or_path,
tokenizer=self.tokenizer,
ds_config=ds_eval_config,
num_padding_at_beginning=self.args.num_padding_at_beginning,
rlhf_training=True)
reward_engine, *_ = deepspeed.initialize(model=reward_model,
config=ds_config)
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez dans le flux deepspeed-chat de l’étape 3, au niveau de _init_reward, et suivez get_eval_ds_config, create_critic_model et deepspeed.initialize. Comparez les rôles de ds_config et ds_eval_config, puis vérifiez si la suppression de la deuxième configuration préserve l’initialisation du modèle de récompense et le comportement de ZeRO.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- machine-learning
- Type d'issue
- Refactorisation
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 35/100