alibaba / alibaba/EasyParallelLibrary
epl单机单卡和单机多卡训练step如何理解
- 主要言語
- Python
- スター
- 272
- フォーク
- 50
- PR マージ指標
- 30日以内にマージされた PR はありません
説明
单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)
想请教下,这个如何理解呢?每个卡分别跑了10step?
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
調査の方向性
scripts/train_dp.sh と添付された resnet_dp.txt/resnet_dp.py の例から始め、1 GPU と 2 GPU のコマンドを、それぞれで報告されたステップ数と比較します。dataset repeat、worker の設定、デバイスごとの実行がステップ数にどのような影響を与えるかを記録します。観測された実行結果によって裏付けられた明確な説明が Issue にあれば完了です。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- python
- 領域
- distributed-systems, machine-learning
- issue の種類
- ドキュメント
- 難易度
- 4/5
- 見積もり時間
- 3〜5日
- 活発さ
- 停滞
- 明瞭さ
- 説明が足りない
- 初心者へのやさしさ
- 35/100