Akegarasu / Akegarasu/lora-scripts

Flux和SDXL的resume save_state继续训练的逻辑是不是不一样?

Aperta
#685 4 commenti 1 reazione 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
6.1k
Fork
699
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

我的理解是如果目标是总共训练5个轮数,
Flux的话每次的继续训练, max_train_epochs都是填5, 更像是个中断方式的继续训练, 另外train_state.json里的current_step是不是bug? 要改成目前为止总共训练了多少步的数值, 而不是默认的这一轮训练了多少步的数值,
不改的话在第三次及以后的继续训练都会和第二次的一样.

而SDXL更像是这次要训练多少轮就在max_train_epochs写多少然后加上之前的轮数 (好像是).

还有就是可能是版本不一样: 在试错的时候发现使用自定义参数, github这个版本是可以, 但显示方式不一样.
max_train_epochs = 3 #目标总轮数 10步/轮
initial_epoch = 3 #从哪一轮开始
initial_step = 20 #从哪一步开始
skip_until_initial_step = true

steps: 33%|██████▋ | 10/30 [08:04<16:08, 48.44s/it, avr_loss=0.407]
07:18:30-043558 INFO Training finished / 训练完成

云端的那个版本的话会被直接忽略, 应该使用的是原来的读取train_state.json的方式.

可能是这个功能用的人的少, 资料好少啊...

最后就是Flux Lora训练有没可能支持20系显卡? 用FP16训练的话会nan, 强制用BF16的话会非常慢.

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.