huggingface / huggingface/diffusers
[New Pipeline]: Audio-Journey: Visual+LLM-aided Audio Encodec Diffusion
- Lenguaje dominante
- Python
- Estrellas
- 34.5k
- Forks
- 7.3k
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 91
Descripción
### Model/Pipeline/Scheduler description
We efficiently trained an Audio Diffusion model with the aid of Alpaca augmented audio captions using AudioSet labels;
[website](https://audiojourney.github.io/)
[preprint](https://github.com/audiojourney/audiojourney.github.io/blob/main/neurIPS_2023_v1.2.pdf)
[Appendix](https://github.com/audiojourney/audiojourney.github.io/blob/main/neurIPS_2023_appendix_v1.3.pdf)
[Implementation](https://github.com/jacksonmichaels/diffusers_with_dataloader)
Weights will be released soon!
### Open source status
- [X] The model implementation is available
- [ ] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
@jacksonmichaels
_No response_
Guía de contribución
Línea de trabajo
Comienza con la implementación de AudioJourney enlazada y lee el preprint y el apéndice enlazados para entender el pipeline propuesto. El issue no menciona archivos ni tests de diffusers; para completarlo habría que confirmar que la implementación del modelo y los pesos están disponibles y definir cómo debe integrarse el nuevo pipeline.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python, pytorch
- Área
- audio-video-rtc, machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 18/100