alibaba / alibaba/EasyParallelLibrary
epl单机单卡和单机多卡训练step如何理解
- Lenguaje dominante
- Python
- Estrellas
- 272
- Forks
- 50
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
单机单卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0 bash ./scripts/train_dp.sh

单机双卡:
启动命令:TF_CONFIG='{"cluster":{"worker":["127.0.0.1:49119"]},"task":{"type":"worker","index":0}}' CUDA_VISIBLE_DEVICES=0,1 bash ./scripts/train_dp.sh

代码修改了一下:去掉了last_step限制,数据集repeat=10,将txt改为py,可执行。
[resnet_dp.txt](https://github.com/alibaba/EasyParallelLibrary/files/12671704/resnet_dp.txt)
想请教下,这个如何理解呢?每个卡分别跑了10step?
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Comienza con scripts/train_dp.sh y el ejemplo adjunto resnet_dp.txt/resnet_dp.py; después, compara los comandos para una sola GPU y para dos GPUs con los pasos indicados en cada caso. Documenta cómo dataset repeat, la configuración de los workers y la ejecución por dispositivo afectan al número de pasos; se considera terminado cuando el issue contiene una explicación clara respaldada por las ejecuciones observadas.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- distributed-systems, machine-learning
- Tipo de issue
- Documentación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 35/100