Akegarasu / Akegarasu/lora-scripts

继续训练失败,KeyError: 'step'

未关闭
#715 2 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
主要语言
Python
星标
6.1k
派生
699
PR 合并指标
30 天内没有已合并 PR

描述

秋叶训练器训练lokr,设置为每步存一个档和一个模型,试过手动终止和强行终止,跑出的40多轮存档都报这个错,继续训练时也能读取 train_state.json 中的轮数和步数,训练参数未变动。
我不知道这个步骤读取的 'step' 起什么作用,总步数和当前步数CMD中都是正确显示的。

All model weights loaded successfully                                  checkpointing.py:214

2025-08-16 22:17:13 INFO     All optimizer states loaded successfully                               checkpointing.py:222

                    INFO     All scheduler states loaded successfully                               checkpointing.py:229

                    INFO     All dataloader sampler states loaded successfully                      checkpointing.py:241

                    INFO     GradScaler state loaded successfully                                   checkpointing.py:247

                    INFO     Could not load random states                                           checkpointing.py:264

Traceback (most recent call last):

  File "H:\M\machinelearning\sdtrainer\scripts\stable\sdxl_train_network.py", line 185, in

    trainer.train(args)

  File "H:\M\machinelearning\sdtrainer\scripts\stable\train_network.py", line 539, in train

    train_util.resume_from_local_or_hf_if_specified(accelerator, args)

  File "H:\M\machinelearning\sdtrainer\scripts\stable\library\train_util.py", line 4047, in resume_from_local_or_hf_if_specified

    accelerator.load_state(args.resume)

  File "H:\M\machinelearning\sdtrainer\python\Lib\site-packages\accelerate\accelerator.py", line 3156, in load_state

    self.step = override_attributes["step"]

                ~~~~~~~~~~~~~~~~~~~^^^^^^^^

KeyError: 'step'

22:17:15-724566 ERROR    Training failed / 训练失败

贡献指南

这个仓库没有索引到贡献指南

评估

这个 Issue 还没有评估数据。

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。