dbiir / dbiir/UER-py

多节点训练问题

Open
#53 1 comment 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
3.1k
Forks
520
PR merge metrics
No merged PRs in 30d

Description

请问多个节点多GPU训练的具体操作是怎样的?

ReadME中的例子:
```
Node-0 : python3 pretrain.py --dataset_path dataset.pt --vocab_path models/google_zh_vocab.txt \
--pretrained_model_path models/google_model.bin --output_model_path models/output_model.bin \
--encoder bert --target bert --world_size 16 --gpu_ranks 0 1 2 3 4 5 6 7 --master_ip tcp://node-0-addr:port
Node-1 : python3 pretrain.py --dataset_path dataset.pt --vocab_path models/google_zh_vocab.txt \
--pretrained_model_path models/google_model.bin --output_model_path models/output_model.bin \
--encoder bert --target bert --world_size 16 --gpu_ranks 8 9 10 11 12 13 14 15 --master_ip tcp://node-0-addr:port
```
这里"Node-0:"和"Node-1:"是什么意思呢?是两条分开的命令吗?在两台机器上分别运行pretrain.py?那怎么保证同时训练呢?

如何在同一个命令中指定多个节点进行训练呢?(例如slurm集群多节点训练?)

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.