huggingface / huggingface/diffusers

Add Lumina-DiMOO as a pipeline

Aperta
#12,358 1 commento 0 reazioni 0 assegnatari Vedi su GitHub
stale
Lingua principale
Python
Stelle
34.5k
Fork
7.3k
Merge medio
3g 3h
PR unite (30g)
91

Descrizione

### Model/Pipeline/Scheduler description

Lumina-DiMOO is a unified multimodal model built on fully discrete diffusion. It supports a wide range of tasks, including text-to-image, image-to-image (editing, subject-driven generation, inpainting), and image understanding. It also outperforms existing open-source multimodal models with stronger results and much higher sampling efficiency. It would be great to have this model in diffusers.

### Open source status

- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).

### Provide useful links for the implementation

project page: https://synbol.github.io/Lumina-DiMOO
code: https://github.com/Alpha-VLLM/Lumina-DiMOO
model weights: https://huggingface.co/Alpha-VLLM/Lumina-DiMOO

@synbol @ChinChyi

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia leggendo la pagina del progetto Lumina-DiMOO collegata e la relativa implementazione, quindi esamina i pesi del modello su Hugging Face. Determina come le sue attività di text-to-image, image-to-image, inpainting, subject-driven generation e image-understanding corrispondano a una pipeline di diffusers. Il lavoro è completato quando Lumina-DiMOO è disponibile in diffusers con le capacità del modello richieste.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python, pytorch
Ambito
machine-learning
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.