huggingface / huggingface/diffusers
[New Pipeline/Model] Add JoyAI-Echo multi-shot audio-video generation pipeline
- Lingua principale
- Python
- Stelle
- 34.5k
- Fork
- 7.3k
- Merge medio
- 3g 3h
- PR unite (30g)
- 91
Descrizione
### Model/Pipeline/Scheduler description
**We are the JoyAI Team (JD.com)**, proposing the integration of JoyAI-Echo into Diffusers.
**JoyAI-Echo** is a unified framework for long-form audio-visual generation, designed to support minute-level video creation with synchronized audio, strong temporal consistency, and real-time interaction.
Key innovations:
- **Cross-modal audio-visual memory bank**: preserves character appearance and voice timbre across long sequences (up to minutes)
- **DMD-distilled few-step inference**: ~7.5× faster than baseline while improving alignment and visual quality
- **Joint audio-video generation**: a single pipeline produces synchronized video and audio
- **Multi-shot story generation**: generates coherent sequences of shots from prompt lists
The architecture builds on LTX-2 and adds the JoyAI-Echo DMD denoising schedule plus a paired audio-video memory bank for cross-shot consistency.
### Open source status
- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
- GitHub Repository: https://github.com/jd-opensource/JoyAI-Echo
- HuggingFace Weights: https://huggingface.co/jdopensource/JoyAI-Echo
- Diffusers implementation PR: (will link after PR is created)
### Additional context
We (JoyAI Team) previously contributed JoyAI-Image-Edit to Diffusers (PR #13444, merged). This follows the same pattern — official team providing a complete, tested implementation.
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia dal repository JoyAI-Echo e dai pesi HuggingFace collegati nell'issue, quindi confronta la loro implementazione con il supporto esistente per LTX-2 in Diffusers. L'issue descrive una pipeline audio-video multi-shot con modifiche allo scheduling di memory-bank e DMD, ma non indica file o test di Diffusers. Il lavoro sarà considerato completato quando saranno disponibili un'integrazione completa e testata e una pull request di implementazione collegata.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python, pytorch
- Ambito
- audio-video-rtc, machine-learning
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Tranquilla
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 40/100