Akegarasu / Akegarasu/lora-scripts

Flux和SDXL的resume save_state继续训练的逻辑是不是不一样?

Abierto
#685 4 comentarios 1 reacción 0 asignados Ver en GitHub
Lenguaje dominante
Python
Estrellas
6.1k
Forks
699
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

我的理解是如果目标是总共训练5个轮数,
Flux的话每次的继续训练, max_train_epochs都是填5, 更像是个中断方式的继续训练, 另外train_state.json里的current_step是不是bug? 要改成目前为止总共训练了多少步的数值, 而不是默认的这一轮训练了多少步的数值,
不改的话在第三次及以后的继续训练都会和第二次的一样.

而SDXL更像是这次要训练多少轮就在max_train_epochs写多少然后加上之前的轮数 (好像是).

还有就是可能是版本不一样: 在试错的时候发现使用自定义参数, github这个版本是可以, 但显示方式不一样.
max_train_epochs = 3 #目标总轮数 10步/轮
initial_epoch = 3 #从哪一轮开始
initial_step = 20 #从哪一步开始
skip_until_initial_step = true

steps: 33%|██████▋ | 10/30 [08:04<16:08, 48.44s/it, avr_loss=0.407]
07:18:30-043558 INFO Training finished / 训练完成

云端的那个版本的话会被直接忽略, 应该使用的是原来的读取train_state.json的方式.

可能是这个功能用的人的少, 资料好少啊...

最后就是Flux Lora训练有没可能支持20系显卡? 用FP16训练的话会nan, 强制用BF16的话会非常慢.

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Evaluación

Este issue todavía no se ha evaluado.

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.