Akegarasu / Akegarasu/lora-scripts

Flux和SDXL的resume save_state继续训练的逻辑是不是不一样?

Đang mở
#685 4 bình luận 1 reaction 0 người được giao Xem trên GitHub
Ngôn ngữ chính
Python
Star
6.1k
Fork
699
Chỉ số merge pull request
Không có pull request nào được merge trong 30 ngày

Mô tả

我的理解是如果目标是总共训练5个轮数,
Flux的话每次的继续训练, max_train_epochs都是填5, 更像是个中断方式的继续训练, 另外train_state.json里的current_step是不是bug? 要改成目前为止总共训练了多少步的数值, 而不是默认的这一轮训练了多少步的数值,
不改的话在第三次及以后的继续训练都会和第二次的一样.

而SDXL更像是这次要训练多少轮就在max_train_epochs写多少然后加上之前的轮数 (好像是).

还有就是可能是版本不一样: 在试错的时候发现使用自定义参数, github这个版本是可以, 但显示方式不一样.
max_train_epochs = 3 #目标总轮数 10步/轮
initial_epoch = 3 #从哪一轮开始
initial_step = 20 #从哪一步开始
skip_until_initial_step = true

steps: 33%|██████▋ | 10/30 [08:04<16:08, 48.44s/it, avr_loss=0.407]
07:18:30-043558 INFO Training finished / 训练完成

云端的那个版本的话会被直接忽略, 应该使用的是原来的读取train_state.json的方式.

可能是这个功能用的人的少, 资料好少啊...

最后就是Flux Lora训练有没可能支持20系显卡? 用FP16训练的话会nan, 强制用BF16的话会非常慢.

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Đánh giá

Issue này chưa được đánh giá.

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.