alibaba / alibaba/EasyParallelLibrary
epl单机单卡和单机多卡训练step如何理解
- 主要语言
- Python
- 星标
- 272
- 派生
- 50
- PR 合并指标
- 30 天内没有已合并 PR
描述
单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)
想请教下,这个如何理解呢?每个卡分别跑了10step?
贡献指南
这个仓库没有索引到贡献指南
调研方向
从 scripts/train_dp.sh 和附带的 resnet_dp.txt/resnet_dp.py 示例开始,然后将单 GPU 和双 GPU 命令与其报告的步数进行比较。记录 dataset repeat、worker 配置和每设备执行如何影响步数;当 issue 有一份由观察到的运行结果支持的清晰解释时,即视为完成。
由索引模型根据 Issue 内容生成。
评估
- 技术栈
- python
- 领域
- distributed-systems, machine-learning
- Issue 类型
- 文档
- 难度
- 4/5
- 预计耗时
- 3-5 天
- 活跃度
- 停滞
- 描述清晰度
- 需要澄清
- 新手友好度
- 35/100