Akegarasu / Akegarasu/lora-scripts

在使用 resume 遇到训练报错

Aperta
#627 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
6.1k
Fork
699
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

由于上一次训练开启了保存训练状态。中断之后,在下一次启用 resume ,输入 路径:D:\lora-scripts-v1.5.1\output\galasports_soccerxl_lora_v1.0-000004-state

其他训练参数和上一次保存的一致,开启训练出现报错如下:

File "/root/miniconda3/lib/python3.12/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
./scripts/sdxl_train_network.py FAILED
------------------------------------------------------------
Failures:

------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2025-02-14_11:26:27
host : 3da460f1d2fb
rank : 2 (local_rank: 2)
exitcode : 1 (pid: 1117)
error_file:
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html

我的问题是开启了resume,是否需要开启分布式训练?这个参数和resume是否要搭配使用。如果和分布式训练参数没关系,为什么会出现报错?

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.