microsoft / microsoft/TransformerCompression

How to finetune with multi-gpus under data parallel setting?

Aperta
#167 1 commento 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Lingua principale
Python
Stelle
460
Fork
58
Merge medio
8h 40m
PR unite (30g)
1

Descrizione

Many thanks for sharing the amazing work!

I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Direzione di ricerca

Inizia leggendo l’entry point distribute-model e tutta la documentazione circostante sul fine-tuning per determinare in che modo il suo comportamento di parallelismo del modello differisca dalla configurazione di parallelismo dei dati richiesta. L’issue non indica file o test; per completarla sarebbe necessario un percorso di fine-tuning multi-GPU concordato e riproducibile, oppure una documentazione che spieghi se è supportato.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
distributed-systems, machine-learning
Tipo di issue
Documentazione
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
20/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.