bigscience-workshop / bigscience-workshop/Megatron-DeepSpeed

the traing log like this is Normal? I do not find loss in the logs, and what does the "grad norm: nan" mean?

Aperta
#396 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
1.4k
Fork
226
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

d norm: nan | actual seqlen: 2048 | number of skipped iterations: 0 | number of nan iterations: 0 | samples per second: 1.886 | TFLOPs: 78.46 |
iteration 5426/ 250000 | consumed samples: 43408 | consumed tokens: 88899584 | elapsed time per iteration (ms): 4247.9 | learning rate: 2.999E-04 | global batch size: 8 | loss scale: 1.0 | grad norm: nan | actual seqlen: 2048 | number of skipped iterations: 0 | number of nan iterations: 0 | samples per second: 1.883 | TFLOPs: 78.36 |
iteration 5427/ 250000 | consumed samples: 43416 | consumed tokens: 88915968 | elapsed time per iteration (ms): 4225.8 | learning rate: 2.999E-04 | global batch size: 8 | loss scale: 1.0 | grad norm: nan | actual seqlen: 2048 | number of skipped iterations: 0 | number of nan iterations: 0 | samples per second: 1.893 | TFLOPs: 78.77 |
iteration 5428/ 250000 | consumed samples: 43424 | consumed tokens: 88932352 | elapsed time per iteration (ms): 4229.2 | learning rate: 2.999E-04 | global batch size: 8 | loss scale: 1.0 | grad norm: nan | actual seqlen: 2048 | number of skipped iterations: 0 | number of nan iterations: 0 | samples per second: 1.892 | TFLOPs: 78.71 |
iteration 5429/ 250000 | consumed samples: 43432 | consumed tokens: 88948736 | elapsed time per iteration (ms): 4233.6 | learning rate: 2.999E-04 | global batch size: 8 | loss scale: 1.0 | grad norm: nan | actual seqlen: 2048 | number of skipped iterations: 0 | number of nan iterations: 0 | samples per second: 1.890 | TFLOPs: 78.63 |
iteration 5430/ 250000 | consumed samples: 43440 | consumed tokens: 88965120 | elapsed time per iteration (ms): 4247.0 | learning rate: 2.999E-04 | global batch size: 8 | loss scale: 1.0 | grad norm: nan | actual seqlen: 2048 | number of skipped iterations: 0 | number of nan iterations: 0 | samples per second: 1.884 | TFLOPs: 78.38 |

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Nella issue non sono identificati alcun file sorgente, test o punto di ingresso. Inizia individuando il codice che formatta il log di training mostrato, quindi riproduci l’output segnalato e determina perché la loss è assente e la norma del grad è NaN. Il lavoro è completato quando il comportamento è spiegato e qualsiasi problema confermato di logging o training dispone di un regression test o di una risoluzione documentata.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
machine-learning
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.