huggingface / huggingface/diffusers
Add Lumina-DiMOO as a pipeline
- Lingua principale
- Python
- Stelle
- 34.5k
- Fork
- 7.3k
- Merge medio
- 3g 3h
- PR unite (30g)
- 91
Descrizione
### Model/Pipeline/Scheduler description
Lumina-DiMOO is a unified multimodal model built on fully discrete diffusion. It supports a wide range of tasks, including text-to-image, image-to-image (editing, subject-driven generation, inpainting), and image understanding. It also outperforms existing open-source multimodal models with stronger results and much higher sampling efficiency. It would be great to have this model in diffusers.
### Open source status
- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
project page: https://synbol.github.io/Lumina-DiMOO
code: https://github.com/Alpha-VLLM/Lumina-DiMOO
model weights: https://huggingface.co/Alpha-VLLM/Lumina-DiMOO
@synbol @ChinChyi
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia leggendo la pagina del progetto Lumina-DiMOO collegata e la relativa implementazione, quindi esamina i pesi del modello su Hugging Face. Determina come le sue attività di text-to-image, image-to-image, inpainting, subject-driven generation e image-understanding corrispondano a una pipeline di diffusers. Il lavoro è completato quando Lumina-DiMOO è disponibile in diffusers con le capacità del modello richieste.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python, pytorch
- Ambito
- machine-learning
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 25/100