bigscience-workshop / bigscience-workshop/Megatron-DeepSpeed

"Mask is silently ignored due to the use of a custom kernel" with pretrain_gpt_single_node.sh

Aperta
#320 4 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
1.4k
Fork
226
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

## Update

The issue turned out to be DeepSpeed usages of `pretrain_gpt_single_node.sh`.
I will make a pull request soon.

## Original Report

Please let me know what details I shall provide, thank you!

Python 3.7.12
pt=1.11.0+cu113, cuda=11.3

Using `pretrain_gpt_single_node.sh` with the instructions on README:
```
[...]/megatron/model/fused_softmax.py", line 191, in forward_fused_softmax
assert mask is None, "Mask is silently ignored due to the use of a custom kernel"
```

Also tried `--no-masked-softmax-fusion` but no differences except the line.
```
[...]/megatron/model/fused_softmax.py", line 218, in forward_torch_softmax
assert mask is None
```

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia con le istruzioni del README per pretrain_gpt_single_node.sh, quindi esamina megatron/model/fused_softmax.py in corrispondenza delle assertions segnalate. Riproduci il failure con e senza --no-masked-softmax-fusion e analizza l’uso di DeepSpeed indicato. Il lavoro sarà completato quando sarà confermata una risoluzione oppure sarà disponibile una pull request collegata che descriva la modifica necessaria.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
machine-learning
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.