alibaba / alibaba/EasyParallelLibrary
epl单机单卡和单机多卡训练step如何理解
- Ngôn ngữ chính
- Python
- Star
- 272
- Fork
- 50
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Mô tả
单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)
想请教下,这个如何理解呢?每个卡分别跑了10step?
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Bắt đầu với scripts/train_dp.sh và ví dụ resnet_dp.txt/resnet_dp.py được đính kèm, sau đó so sánh các lệnh cho một GPU và hai GPU với số bước được báo cáo tương ứng. Ghi lại cách dataset repeat, cấu hình worker và việc thực thi trên từng thiết bị ảnh hưởng đến số bước; được xem là hoàn thành khi issue có một giải thích rõ ràng được hỗ trợ bởi các lần chạy đã quan sát.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- python
- Lĩnh vực
- distributed-systems, machine-learning
- Loại issue
- Tài liệu
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Cần làm rõ
- Mức phù hợp với người mới
- 35/100