huggingface / huggingface/diffusers
Flux Inference memory optimisation by pre-computing modulation parameters ahead of time
- Langage dominant
- Python
- Étoiles
- 34.5k
- Forks
- 7.3k
- Merge moyen
- 3 j 3 h
- PR mergées (30 j)
- 91
Description
DiffusionKit has an excellent memory optimisation for Flux where it calculates modulation parameters ahead of time
then offloads the adaLN_modulation parameters which for fp16 saves ~ 6.5 GB peak memory usage during inference.
https://github.com/argmaxinc/DiffusionKit/pull/15/
It would be nice if a similar change could be made to Diffusers.
It's especially useful for MPS users who are getting left behind with the current trend using quantisation to reduce memory usage rather than optimisation and for whom CPU offloading is not a thing.
Guide de contribution
Ouvrir le guide de contribution
Piste de recherche
Aucun fichier ou test de Diffusers n'est nommé. Commencez par lire le pull request lié de DiffusionKit, puis localisez l'inférence de Flux et la gestion des paramètres de modulation dans Diffusers. La tâche est considérée comme terminée lorsque vous avez obtenu la précomputing analogue et la réduction de mémoire grâce à l'offloading, tout en préservant le comportement de l'inférence, y compris pour les utilisateurs de MPS.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python, pytorch
- Domaine
- machine-learning, performance
- Type d'issue
- Refactorisation
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 38/100