huggingface / huggingface/diffusers
Add VideoDeltaNet-H3 Model
- Lingua principale
- Python
- Stelle
- 34.5k
- Fork
- 7.3k
- Merge medio
- 3g 3h
- PR unite (30g)
- 91
Descrizione
### Model/Pipeline/Scheduler description
VideoDeltaNet (VDN-H3) is a hybrid-attention variant of MiniMax H3 designed for faster video generation with near-lossless quality. It replaces dense video-video attention with a combination of local sliding-window softmax attention and long-range linear attention, while keeping the original H3 backbone largely unchanged.
All weights and training and inference code are available.
### Open source status
- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
Weight: https://huggingface.co/OpenVDN/vdn-minimax-h3
Code: https://github.com/OpenVDN/vdn-minimax-h3
I'm the author :)
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia leggendo l'implementazione del modello all'indirizzo https://github.com/OpenVDN/vdn-minimax-h3 e esaminando i pesi all'indirizzo https://huggingface.co/OpenVDN/vdn-minimax-h3. Confronta quindi l'implementazione con le integrazioni esistenti di modelli, pipeline e scheduler in diffusers. Il lavoro è completo quando VideoDeltaNet-H3 è stato aggiunto a diffusers con i relativi pesi disponibili e il supporto documentato per l'inferenza.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python, pytorch
- Ambito
- machine-learning
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Attiva
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 35/100