alibaba / alibaba/EasyParallelLibrary

epl单机单卡和单机多卡训练step如何理解

未关闭
#30 1 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
主要语言
Python
星标
272
派生
50
PR 合并指标
30 天内没有已合并 PR

描述

单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh
![image](https://github.com/alibaba/EasyParallelLibrary/assets/28698695/bc38cc24-48b4-452c-8993-546847954fb4)

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh
![1693045873752](https://github.com/alibaba/EasyParallelLibrary/assets/28698695/20739a66-8667-46f8-bc5d-1fd5993b0ba5)

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)

想请教下,这个如何理解呢?每个卡分别跑了10step?

贡献指南

这个仓库没有索引到贡献指南

调研方向

从 scripts/train_dp.sh 和附带的 resnet_dp.txt/resnet_dp.py 示例开始,然后将单 GPU 和双 GPU 命令与其报告的步数进行比较。记录 dataset repeat、worker 配置和每设备执行如何影响步数;当 issue 有一份由观察到的运行结果支持的清晰解释时,即视为完成。

由索引模型根据 Issue 内容生成。

评估

技术栈
python
领域
distributed-systems, machine-learning
Issue 类型
文档
难度
4/5
预计耗时
3-5 天
活跃度
停滞
描述清晰度
需要澄清
新手友好度
35/100

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。