huggingface / huggingface/diffusers

[New Pipeline/Model] Add JoyAI-Echo multi-shot audio-video generation pipeline

Aperta
#13,909 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
feature-request models pipelines
Lingua principale
Python
Stelle
34.5k
Fork
7.3k
Merge medio
3g 3h
PR unite (30g)
91

Descrizione

### Model/Pipeline/Scheduler description

**We are the JoyAI Team (JD.com)**, proposing the integration of JoyAI-Echo into Diffusers.

**JoyAI-Echo** is a unified framework for long-form audio-visual generation, designed to support minute-level video creation with synchronized audio, strong temporal consistency, and real-time interaction.

Key innovations:
- **Cross-modal audio-visual memory bank**: preserves character appearance and voice timbre across long sequences (up to minutes)
- **DMD-distilled few-step inference**: ~7.5× faster than baseline while improving alignment and visual quality
- **Joint audio-video generation**: a single pipeline produces synchronized video and audio
- **Multi-shot story generation**: generates coherent sequences of shots from prompt lists

The architecture builds on LTX-2 and adds the JoyAI-Echo DMD denoising schedule plus a paired audio-video memory bank for cross-shot consistency.

### Open source status

- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).

### Provide useful links for the implementation

- GitHub Repository: https://github.com/jd-opensource/JoyAI-Echo
- HuggingFace Weights: https://huggingface.co/jdopensource/JoyAI-Echo
- Diffusers implementation PR: (will link after PR is created)

### Additional context

We (JoyAI Team) previously contributed JoyAI-Image-Edit to Diffusers (PR #13444, merged). This follows the same pattern — official team providing a complete, tested implementation.

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia dal repository JoyAI-Echo e dai pesi HuggingFace collegati nell'issue, quindi confronta la loro implementazione con il supporto esistente per LTX-2 in Diffusers. L'issue descrive una pipeline audio-video multi-shot con modifiche allo scheduling di memory-bank e DMD, ma non indica file o test di Diffusers. Il lavoro sarà considerato completato quando saranno disponibili un'integrazione completa e testata e una pull request di implementazione collegata.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python, pytorch
Ambito
audio-video-rtc, machine-learning
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Tranquilla
Chiarezza
Abbastanza chiara
Idoneità per principianti
40/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.