huggingface / huggingface/diffusers
F5-TTS Integration
- Lenguaje dominante
- Python
- Estrellas
- 34.5k
- Forks
- 7.3k
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 91
Descripción
### Model/Pipeline/Scheduler description
F5-TTS is a fully non-autoregressive text-to-speech system based on flow matching with Diffusion Transformer (DiT).
It has excellent voice cloning capabilities, and audio generation is of quite high quality.
### Open source status
- [X] The model implementation is available.
- [X] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
Paper - https://arxiv.org/abs/2410.06885
Code - https://github.com/SWivid/F5-TTS?tab=readme-ov-file
Weights - https://huggingface.co/SWivid/F5-TTS
Author - @SWivid
Guía de contribución
Línea de trabajo
Comienza leyendo el paper de F5-TTS y la implementación enlazada de SWivid/F5-TTS; después, inspecciona los pesos del modelo en Hugging Face. Compara la arquitectura existente de diffusers para la generación de audio con F5-TTS para determinar los puntos de integración. La tarea se considera terminada cuando F5-TTS sea compatible con diffusers, pero el issue no define archivos, pruebas ni criterios de aceptación específicos.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- huggingface, python, pytorch
- Área
- audio-video-rtc, machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Activo
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 35/100