Akegarasu / Akegarasu/lora-scripts
在使用 resume 遇到训练报错
- 主要言語
- Python
- スター
- 6.1k
- フォーク
- 699
- PR マージ指標
- 30日以内にマージされた PR はありません
説明
由于上一次训练开启了保存训练状态。中断之后,在下一次启用 resume ,输入 路径:D:\lora-scripts-v1.5.1\output\galasports_soccerxl_lora_v1.0-000004-state
其他训练参数和上一次保存的一致,开启训练出现报错如下:
File "/root/miniconda3/lib/python3.12/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
./scripts/sdxl_train_network.py FAILED
------------------------------------------------------------
Failures:
------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2025-02-14_11:26:27
host : 3da460f1d2fb
rank : 2 (local_rank: 2)
exitcode : 1 (pid: 1117)
error_file:
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html
我的问题是开启了resume,是否需要开启分布式训练?这个参数和resume是否要搭配使用。如果和分布式训练参数没关系,为什么会出现报错?
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
評価
この issue はまだ評価されていません。