Akegarasu / Akegarasu/lora-scripts

Flux和SDXL的resume save_state继续训练的逻辑是不是不一样?

Offen
#685 4 Kommentare 1 Reaktion 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Python
Sterne
6.1k
Forks
699
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

我的理解是如果目标是总共训练5个轮数,
Flux的话每次的继续训练, max_train_epochs都是填5, 更像是个中断方式的继续训练, 另外train_state.json里的current_step是不是bug? 要改成目前为止总共训练了多少步的数值, 而不是默认的这一轮训练了多少步的数值,
不改的话在第三次及以后的继续训练都会和第二次的一样.

而SDXL更像是这次要训练多少轮就在max_train_epochs写多少然后加上之前的轮数 (好像是).

还有就是可能是版本不一样: 在试错的时候发现使用自定义参数, github这个版本是可以, 但显示方式不一样.
max_train_epochs = 3 #目标总轮数 10步/轮
initial_epoch = 3 #从哪一轮开始
initial_step = 20 #从哪一步开始
skip_until_initial_step = true

steps: 33%|██████▋ | 10/30 [08:04<16:08, 48.44s/it, avr_loss=0.407]
07:18:30-043558 INFO Training finished / 训练完成

云端的那个版本的话会被直接忽略, 应该使用的是原来的读取train_state.json的方式.

可能是这个功能用的人的少, 资料好少啊...

最后就是Flux Lora训练有没可能支持20系显卡? 用FP16训练的话会nan, 强制用BF16的话会非常慢.

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Bewertung

Dieses Issue wurde noch nicht bewertet.

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.