huggingface / huggingface/diffusers
Inquiry About Using Non-Square Images for ControlNet Training
- Lenguaje dominante
- Python
- Estrellas
- 34.5k
- Forks
- 7.3k
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 91
Descripción
Subject: Inquiry About Using Non-Square Images for ControlNet Training
Dear [Team/Developer],
First of all, thank you for providing the training code for ControlNet. I have recently been utilizing this code to train the ControlNet for an sdxl model, and I am quite satisfied with the results. However, I believe there is room for improvement.
During the training process, I noticed that the program crops images into squares. The images I am using are from interior design, which are rarely square and tend to lose their integrity when cropped. I am wondering if it is possible to train with longer or wider images, such as those with aspect ratios of 3:2 or 2:3. Would it be sufficient to modify the image processing part of the code to accommodate these dimensions?
I look forward to your response and thank you very much for your support!
Best regards
Guía de contribución
Línea de trabajo
Comienza localizando el punto de entrada del procesamiento de imágenes del código de entrenamiento de ControlNet/SDXL y siguiendo dónde se recortan las imágenes de entrada en cuadrados. Comprueba cómo se agrupan en batches y se representan las entradas 3:2 y 2:3 durante el entrenamiento; se considera terminado cuando esas relaciones de aspecto pueden entrenarse sin un recorte cuadrado destructivo y las comprobaciones de entrenamiento existentes siguen pasando.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python, pytorch
- Área
- computer-vision, machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100