huggingface / huggingface/diffusers

F5-TTS Integration

Abierto
#10,043 12 comentarios 0 reacciones 0 asignados Ver en GitHub
contributions-welcome help wanted
Lenguaje dominante
Python
Estrellas
34.5k
Forks
7.3k
Merge medio
3 d 3 h
PR fusionados (30 d)
91

Descripción

### Model/Pipeline/Scheduler description

F5-TTS is a fully non-autoregressive text-to-speech system based on flow matching with Diffusion Transformer (DiT).
It has excellent voice cloning capabilities, and audio generation is of quite high quality.

### Open source status

- [X] The model implementation is available.
- [X] The model weights are available (Only relevant if addition is not a scheduler).

### Provide useful links for the implementation

Paper - https://arxiv.org/abs/2410.06885
Code - https://github.com/SWivid/F5-TTS?tab=readme-ov-file
Weights - https://huggingface.co/SWivid/F5-TTS

Author - @SWivid

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza leyendo el paper de F5-TTS y la implementación enlazada de SWivid/F5-TTS; después, inspecciona los pesos del modelo en Hugging Face. Compara la arquitectura existente de diffusers para la generación de audio con F5-TTS para determinar los puntos de integración. La tarea se considera terminada cuando F5-TTS sea compatible con diffusers, pero el issue no define archivos, pruebas ni criterios de aceptación específicos.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
huggingface, python, pytorch
Área
audio-video-rtc, machine-learning
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Activo
Claridad
Necesita aclaración
Aptitud para principiantes
35/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.