多节点训练问题
- Dominant language
- Python
- Stars
- 3.1k
- Forks
- 520
- PR merge metrics
- No merged PRs in 30d
Description
请问多个节点多GPU训练的具体操作是怎样的?
ReadME中的例子:
```
Node-0 : python3 pretrain.py --dataset_path dataset.pt --vocab_path models/google_zh_vocab.txt \
--pretrained_model_path models/google_model.bin --output_model_path models/output_model.bin \
--encoder bert --target bert --world_size 16 --gpu_ranks 0 1 2 3 4 5 6 7 --master_ip tcp://node-0-addr:port
Node-1 : python3 pretrain.py --dataset_path dataset.pt --vocab_path models/google_zh_vocab.txt \
--pretrained_model_path models/google_model.bin --output_model_path models/output_model.bin \
--encoder bert --target bert --world_size 16 --gpu_ranks 8 9 10 11 12 13 14 15 --master_ip tcp://node-0-addr:port
```
这里"Node-0:"和"Node-1:"是什么意思呢?是两条分开的命令吗?在两台机器上分别运行pretrain.py?那怎么保证同时训练呢?
如何在同一个命令中指定多个节点进行训练呢?(例如slurm集群多节点训练?)
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.