alibaba / alibaba/EasyParallelLibrary

epl单机单卡和单机多卡训练step如何理解

オープン
#30 コメント 1 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
Python
スター
272
フォーク
50
PR マージ指標
30日以内にマージされた PR はありません

説明

单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh
![image](https://github.com/alibaba/EasyParallelLibrary/assets/28698695/bc38cc24-48b4-452c-8993-546847954fb4)

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh
![1693045873752](https://github.com/alibaba/EasyParallelLibrary/assets/28698695/20739a66-8667-46f8-bc5d-1fd5993b0ba5)

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)

想请教下,这个如何理解呢?每个卡分别跑了10step?

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

調査の方向性

scripts/train_dp.sh と添付された resnet_dp.txt/resnet_dp.py の例から始め、1 GPU と 2 GPU のコマンドを、それぞれで報告されたステップ数と比較します。dataset repeat、worker の設定、デバイスごとの実行がステップ数にどのような影響を与えるかを記録します。観測された実行結果によって裏付けられた明確な説明が Issue にあれば完了です。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
python
領域
distributed-systems, machine-learning
issue の種類
ドキュメント
難易度
4/5
見積もり時間
3〜5日
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
35/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。