microsoft / microsoft/TransformerCompression

How to finetune with multi-gpus under data parallel setting?

Ouverte
#167 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Langage dominant
Python
Étoiles
460
Forks
58
Merge moyen
8 h 40 min
PR mergées (30 j)
1

Description

Many thanks for sharing the amazing work!

I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Piste de recherche

Commencez par lire le point d’entrée distribute-model et toute la documentation environnante sur le fine-tuning afin de déterminer en quoi son comportement de parallélisme des modèles diffère de la configuration de parallélisme des données demandée. L’issue ne nomme ni fichiers ni tests ; sa réalisation nécessiterait un parcours de fine-tuning multi-GPU convenu et reproductible, ou une documentation expliquant si cette configuration est prise en charge.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
python
Domaine
distributed-systems, machine-learning
Type d'issue
Documentation
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
20/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.