Akegarasu / Akegarasu/lora-scripts

在使用 resume 遇到训练报错

オープン
#627 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
Python
スター
6.1k
フォーク
699
PR マージ指標
30日以内にマージされた PR はありません

説明

由于上一次训练开启了保存训练状态。中断之后,在下一次启用 resume ,输入 路径:D:\lora-scripts-v1.5.1\output\galasports_soccerxl_lora_v1.0-000004-state

其他训练参数和上一次保存的一致,开启训练出现报错如下:

File "/root/miniconda3/lib/python3.12/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
./scripts/sdxl_train_network.py FAILED
------------------------------------------------------------
Failures:

------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2025-02-14_11:26:27
host : 3da460f1d2fb
rank : 2 (local_rank: 2)
exitcode : 1 (pid: 1117)
error_file:
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html

我的问题是开启了resume,是否需要开启分布式训练?这个参数和resume是否要搭配使用。如果和分布式训练参数没关系,为什么会出现报错?

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

評価

この issue はまだ評価されていません。

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。