huggingface / huggingface/diffusers
Add Tortoise TTS as a pipeline
- Langage dominant
- Python
- Étoiles
- 34.5k
- Forks
- 7.3k
- Merge moyen
- 3 j 3 h
- PR mergées (30 j)
- 91
Description
### Model/Pipeline/Scheduler description
TorToise is a multi-voice text-to-speech system, which describes a way to apply recent advances in the image generative domain to speech synthesis. It would be great to have this model in diffusers.
I would love to contribute this.
### Open source status
- [X] The model implementation is available
- [X] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
Paper - https://arxiv.org/pdf/2305.07243.pdf
Github repo - https://github.com/neonbjb/tortoise-tts
@sanchit-gandhi @Vaibhavs10
Guide de contribution
Ouvrir le guide de contribution
Piste de recherche
Commencez par consulter l’article lié sur Tortoise TTS et l’implémentation de neonbjb/tortoise-tts afin de comprendre le modèle et les poids disponibles, puis comparez-les aux intégrations de pipelines Diffusers existantes. La tâche est considérée comme terminée lorsque Tortoise TTS est disponible en tant que pipeline pris en charge dans Diffusers et que son implémentation ainsi que les attentes d’utilisation sont documentées.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python, pytorch
- Domaine
- audio-video-rtc, machine-learning
- Type d'issue
- Fonctionnalité
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 30/100