huggingface / huggingface/diffusers

Add VideoDeltaNet-H3 Model

Aperta
#14,700 13 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
34.5k
Fork
7.3k
Merge medio
3g 3h
PR unite (30g)
91

Descrizione

### Model/Pipeline/Scheduler description

VideoDeltaNet (VDN-H3) is a hybrid-attention variant of MiniMax H3 designed for faster video generation with near-lossless quality. It replaces dense video-video attention with a combination of local sliding-window softmax attention and long-range linear attention, while keeping the original H3 backbone largely unchanged.

All weights and training and inference code are available.

### Open source status

- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).

### Provide useful links for the implementation

Weight: https://huggingface.co/OpenVDN/vdn-minimax-h3
Code: https://github.com/OpenVDN/vdn-minimax-h3
I'm the author :)

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia leggendo l'implementazione del modello all'indirizzo https://github.com/OpenVDN/vdn-minimax-h3 e esaminando i pesi all'indirizzo https://huggingface.co/OpenVDN/vdn-minimax-h3. Confronta quindi l'implementazione con le integrazioni esistenti di modelli, pipeline e scheduler in diffusers. Il lavoro è completo quando VideoDeltaNet-H3 è stato aggiunto a diffusers con i relativi pesi disponibili e il supporto documentato per l'inferenza.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python, pytorch
Ambito
machine-learning
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Attiva
Chiarezza
Abbastanza chiara
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.