Akegarasu / Akegarasu/lora-scripts
Flux和SDXL的resume save_state继续训练的逻辑是不是不一样?
- Dominant language
- Python
- Stars
- 6.1k
- Forks
- 699
- PR merge metrics
- No merged PRs in 30d
Description
我的理解是如果目标是总共训练5个轮数,
Flux的话每次的继续训练, max_train_epochs都是填5, 更像是个中断方式的继续训练, 另外train_state.json里的current_step是不是bug? 要改成目前为止总共训练了多少步的数值, 而不是默认的这一轮训练了多少步的数值,
不改的话在第三次及以后的继续训练都会和第二次的一样.
而SDXL更像是这次要训练多少轮就在max_train_epochs写多少然后加上之前的轮数 (好像是).
还有就是可能是版本不一样: 在试错的时候发现使用自定义参数, github这个版本是可以, 但显示方式不一样.
max_train_epochs = 3 #目标总轮数 10步/轮
initial_epoch = 3 #从哪一轮开始
initial_step = 20 #从哪一步开始
skip_until_initial_step = true
steps: 33%|██████▋ | 10/30 [08:04<16:08, 48.44s/it, avr_loss=0.407]
07:18:30-043558 INFO Training finished / 训练完成
云端的那个版本的话会被直接忽略, 应该使用的是原来的读取train_state.json的方式.
可能是这个功能用的人的少, 资料好少啊...
最后就是Flux Lora训练有没可能支持20系显卡? 用FP16训练的话会nan, 强制用BF16的话会非常慢.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.