huggingface / huggingface/diffusers
[New Pipeline/Model] Add JoyAI-Echo multi-shot audio-video generation pipeline
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Python
- Sterne
- 34.5k
- Forks
- 7.3k
- Ø Merge
- 3 T. 3 Std.
- Gemergte PRs (30 T.)
- 91
Beschreibung
Model/Pipeline/Scheduler description
We are the JoyAI Team (JD.com), proposing the integration of JoyAI-Echo into Diffusers.
JoyAI-Echo is a unified framework for long-form audio-visual generation, designed to support minute-level video creation with synchronized audio, strong temporal consistency, and real-time interaction.
Key innovations:
- Cross-modal audio-visual memory bank: preserves character appearance and voice timbre across long sequences (up to minutes)
- DMD-distilled few-step inference: ~7.5× faster than baseline while improving alignment and visual quality
- Joint audio-video generation: a single pipeline produces synchronized video and audio
- Multi-shot story generation: generates coherent sequences of shots from prompt lists
The architecture builds on LTX-2 and adds the JoyAI-Echo DMD denoising schedule plus a paired audio-video memory bank for cross-shot consistency.
Open source status
- The model implementation is available.
- The model weights are available (Only relevant if addition is not a scheduler).
Provide useful links for the implementation
- GitHub Repository: https://github.com/jd-opensource/JoyAI-Echo
- HuggingFace Weights: https://huggingface.co/jdopensource/JoyAI-Echo
- Diffusers implementation PR: (will link after PR is created)
Additional context
We (JoyAI Team) previously contributed JoyAI-Image-Edit to Diffusers (PR #13444, merged). This follows the same pattern — official team providing a complete, tested implementation.
Beitragsleitfaden
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginne mit dem im Issue verlinkten JoyAI-Echo-Repository und den HuggingFace-Gewichten und vergleiche anschließend deren Implementierung mit der bestehenden LTX-2-Unterstützung in Diffusers. Das Issue beschreibt eine Multi-Shot-Audio-Video-Pipeline mit Änderungen an Memory-Bank- und DMD-Scheduling, nennt jedoch keine Diffusers-Dateien oder Tests. Als abgeschlossen gilt die Aufgabe, wenn eine vollständige, getestete Integration und ein verlinkter Implementierungs-Pull-Request vorliegen.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python, pytorch
- Bereich
- audio-video-rtc, machine-learning
- Issue-Typ
- Feature
- Schwierigkeit
- 5/5
- Geschätzter Aufwand
- Über eine Woche
- Aktivitätsstatus
- Ruhig
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 40/100