Akegarasu / Akegarasu/lora-scripts

在使用 resume 遇到训练报错

Abierto
#627 0 comentarios 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
Python
Estrellas
6.1k
Forks
699
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

由于上一次训练开启了保存训练状态。中断之后,在下一次启用 resume ,输入 路径:D:\lora-scripts-v1.5.1\output\galasports_soccerxl_lora_v1.0-000004-state

其他训练参数和上一次保存的一致,开启训练出现报错如下:

File "/root/miniconda3/lib/python3.12/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
./scripts/sdxl_train_network.py FAILED
------------------------------------------------------------
Failures:

------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2025-02-14_11:26:27
host : 3da460f1d2fb
rank : 2 (local_rank: 2)
exitcode : 1 (pid: 1117)
error_file:
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html

我的问题是开启了resume,是否需要开启分布式训练?这个参数和resume是否要搭配使用。如果和分布式训练参数没关系,为什么会出现报错?

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Evaluación

Este issue todavía no se ha evaluado.

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.