microsoft / microsoft/TransformerCompression
How to finetune with multi-gpus under data parallel setting?
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 460
- Forks
- 58
- Merge moyen
- 8 h 40 min
- PR mergées (30 j)
- 1
Description
Many thanks for sharing the amazing work!
I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez par lire le point d’entrée distribute-model et toute la documentation environnante sur le fine-tuning afin de déterminer en quoi son comportement de parallélisme des modèles diffère de la configuration de parallélisme des données demandée. L’issue ne nomme ni fichiers ni tests ; sa réalisation nécessiterait un parcours de fine-tuning multi-GPU convenu et reproductible, ou une documentation expliquant si cette configuration est prise en charge.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- distributed-systems, machine-learning
- Type d'issue
- Documentation
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 20/100