bigscience-workshop / bigscience-workshop/Megatron-DeepSpeed
"Mask is silently ignored due to the use of a custom kernel" with pretrain_gpt_single_node.sh
- Lingua principale
- Python
- Stelle
- 1.4k
- Fork
- 226
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
## Update
The issue turned out to be DeepSpeed usages of `pretrain_gpt_single_node.sh`.
I will make a pull request soon.
## Original Report
Please let me know what details I shall provide, thank you!
Python 3.7.12
pt=1.11.0+cu113, cuda=11.3
Using `pretrain_gpt_single_node.sh` with the instructions on README:
```
[...]/megatron/model/fused_softmax.py", line 191, in forward_fused_softmax
assert mask is None, "Mask is silently ignored due to the use of a custom kernel"
```
Also tried `--no-masked-softmax-fusion` but no differences except the line.
```
[...]/megatron/model/fused_softmax.py", line 218, in forward_torch_softmax
assert mask is None
```
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Inizia con le istruzioni del README per pretrain_gpt_single_node.sh, quindi esamina megatron/model/fused_softmax.py in corrispondenza delle assertions segnalate. Riproduci il failure con e senza --no-masked-softmax-fusion e analizza l’uso di DeepSpeed indicato. Il lavoro sarà completato quando sarà confermata una risoluzione oppure sarà disponibile una pull request collegata che descriva la modifica necessaria.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- machine-learning
- Tipo di issue
- Bug
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 25/100