huggingface / huggingface/diffusers

[New Pipeline]: Audio-Journey: Visual+LLM-aided Audio Encodec Diffusion

Abierto
#3,826 3 comentarios 0 reacciones 0 asignados Ver en GitHub
community-examples New pipeline/model
Lenguaje dominante
Python
Estrellas
34.5k
Forks
7.3k
Merge medio
3 d 3 h
PR fusionados (30 d)
91

Descripción

### Model/Pipeline/Scheduler description

We efficiently trained an Audio Diffusion model with the aid of Alpaca augmented audio captions using AudioSet labels;
[website](https://audiojourney.github.io/)
[preprint](https://github.com/audiojourney/audiojourney.github.io/blob/main/neurIPS_2023_v1.2.pdf)
[Appendix](https://github.com/audiojourney/audiojourney.github.io/blob/main/neurIPS_2023_appendix_v1.3.pdf)
[Implementation](https://github.com/jacksonmichaels/diffusers_with_dataloader)
Weights will be released soon!

### Open source status

- [X] The model implementation is available
- [ ] The model weights are available (Only relevant if addition is not a scheduler).

### Provide useful links for the implementation
@jacksonmichaels

_No response_

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza con la implementación de AudioJourney enlazada y lee el preprint y el apéndice enlazados para entender el pipeline propuesto. El issue no menciona archivos ni tests de diffusers; para completarlo habría que confirmar que la implementación del modelo y los pesos están disponibles y definir cómo debe integrarse el nuevo pipeline.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python, pytorch
Área
audio-video-rtc, machine-learning
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
18/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.