alibaba / alibaba/EasyParallelLibrary
epl单机单卡和单机多卡训练step如何理解
- Vorherrschende Sprache
- Python
- Sterne
- 272
- Forks
- 50
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)
想请教下,这个如何理解呢?每个卡分别跑了10step?
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Rechercherichtung
Beginne mit scripts/train_dp.sh und dem angehängten Beispiel resnet_dp.txt/resnet_dp.py und vergleiche anschließend die Befehle für eine einzelne GPU und für zwei GPUs mit den jeweils gemeldeten Schritten. Dokumentiere, wie dataset repeat, die Worker-Konfiguration und die Ausführung pro Gerät die Schrittanzahl beeinflussen; als erledigt gilt die Aufgabe, wenn das Issue eine klare, durch die beobachteten Läufe gestützte Erklärung enthält.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- distributed-systems, machine-learning
- Issue-Typ
- Dokumentation
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 35/100