huggingface / huggingface/diffusers

Flux Inference memory optimisation by pre-computing modulation parameters ahead of time

Ouverte
#9,197 3 commentaires 2 réactions 0 personnes assignées Voir sur GitHub
stale
Langage dominant
Python
Étoiles
34.5k
Forks
7.3k
Merge moyen
3 j 3 h
PR mergées (30 j)
91

Description

DiffusionKit has an excellent memory optimisation for Flux where it calculates modulation parameters ahead of time
then offloads the adaLN_modulation parameters which for fp16 saves ~ 6.5 GB peak memory usage during inference.

https://github.com/argmaxinc/DiffusionKit/pull/15/

It would be nice if a similar change could be made to Diffusers.

It's especially useful for MPS users who are getting left behind with the current trend using quantisation to reduce memory usage rather than optimisation and for whom CPU offloading is not a thing.

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

Aucun fichier ou test de Diffusers n'est nommé. Commencez par lire le pull request lié de DiffusionKit, puis localisez l'inférence de Flux et la gestion des paramètres de modulation dans Diffusers. La tâche est considérée comme terminée lorsque vous avez obtenu la précomputing analogue et la réduction de mémoire grâce à l'offloading, tout en préservant le comportement de l'inférence, y compris pour les utilisateurs de MPS.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
python, pytorch
Domaine
machine-learning, performance
Type d'issue
Refactorisation
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
38/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.