microsoft / microsoft/TransformerCompression
How to finetune with multi-gpus under data parallel setting?
Nessuno ha ancora preso questa issue.
- Lingua principale
- Python
- Stelle
- 460
- Fork
- 58
- Merge medio
- 8h 40m
- PR unite (30g)
- 1
Descrizione
Many thanks for sharing the amazing work!
I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Direzione di ricerca
Inizia leggendo l’entry point distribute-model e tutta la documentazione circostante sul fine-tuning per determinare in che modo il suo comportamento di parallelismo del modello differisca dalla configurazione di parallelismo dei dati richiesta. L’issue non indica file o test; per completarla sarebbe necessario un percorso di fine-tuning multi-GPU concordato e riproducibile, oppure una documentazione che spieghi se è supportato.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- distributed-systems, machine-learning
- Tipo di issue
- Documentazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 20/100