huggingface / huggingface/diffusers

[New Pipeline/Model] Add JoyAI-Echo multi-shot audio-video generation pipeline

Offen
#13,909 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

feature-request models pipelines
Vorherrschende Sprache
Python
Sterne
34.5k
Forks
7.3k
Ø Merge
3 T. 3 Std.
Gemergte PRs (30 T.)
91

Beschreibung

Model/Pipeline/Scheduler description

We are the JoyAI Team (JD.com), proposing the integration of JoyAI-Echo into Diffusers.

JoyAI-Echo is a unified framework for long-form audio-visual generation, designed to support minute-level video creation with synchronized audio, strong temporal consistency, and real-time interaction.

Key innovations:

  • Cross-modal audio-visual memory bank: preserves character appearance and voice timbre across long sequences (up to minutes)
  • DMD-distilled few-step inference: ~7.5× faster than baseline while improving alignment and visual quality
  • Joint audio-video generation: a single pipeline produces synchronized video and audio
  • Multi-shot story generation: generates coherent sequences of shots from prompt lists

The architecture builds on LTX-2 and adds the JoyAI-Echo DMD denoising schedule plus a paired audio-video memory bank for cross-shot consistency.

Open source status
  • The model implementation is available.
  • The model weights are available (Only relevant if addition is not a scheduler).
Provide useful links for the implementation
Additional context

We (JoyAI Team) previously contributed JoyAI-Image-Edit to Diffusers (PR #13444, merged). This follows the same pattern — official team providing a complete, tested implementation.

Beitragsleitfaden

Beitragsleitfaden öffnen

Erste Schritte

  1. Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
  3. Forke das Repository und arbeite in einem Branch.
  4. Öffne einen Pull Request, der die Issue-Nummer nennt.

Rechercherichtung

Beginne mit dem im Issue verlinkten JoyAI-Echo-Repository und den HuggingFace-Gewichten und vergleiche anschließend deren Implementierung mit der bestehenden LTX-2-Unterstützung in Diffusers. Das Issue beschreibt eine Multi-Shot-Audio-Video-Pipeline mit Änderungen an Memory-Bank- und DMD-Scheduling, nennt jedoch keine Diffusers-Dateien oder Tests. Als abgeschlossen gilt die Aufgabe, wenn eine vollständige, getestete Integration und ein verlinkter Implementierungs-Pull-Request vorliegen.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python, pytorch
Bereich
audio-video-rtc, machine-learning
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Ruhig
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
40/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.