AlibabaResearch / AlibabaResearch/AdvancedLiterateMachinery

Omni如何进行分布式训练?

Offen
#210 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
C++
Sterne
1.8k
Forks
195
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

我使用如下命令进行多卡分布式训练:
CUDA_VISIBLE_DEVICES=5,6 python -m torch.distributed.run \
main.py \
--data_root ./text_spotting_datasets/ \
--output_folder ./output/pretrain/stage1/ \
--train_dataset totaltext_train mlt_train ic13_train ic15_train syntext1_train syntext2_train \
--lr 0.0005 \
--max_steps 400000 \
--warmup_steps 5000 \
--checkpoint_freq 10000 \
--batch_size 6 \
--tfm_pre_norm \
--train_max_size 768 \
--rec_loss_weight 2 \
--use_fpn \
--use_char_window_prompt
但是实际上只有5号卡在训练,6号卡没有显存占用

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Bewertung

Dieses Issue wurde noch nicht bewertet.

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.