huggingface / huggingface/diffusers

Add Tortoise TTS as a pipeline

Ouverte
#3,891 16 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Good second issue New pipeline/model
Langage dominant
Python
Étoiles
34.5k
Forks
7.3k
Merge moyen
3 j 3 h
PR mergées (30 j)
91

Description

### Model/Pipeline/Scheduler description

TorToise is a multi-voice text-to-speech system, which describes a way to apply recent advances in the image generative domain to speech synthesis. It would be great to have this model in diffusers.
I would love to contribute this.

### Open source status

- [X] The model implementation is available
- [X] The model weights are available (Only relevant if addition is not a scheduler).

### Provide useful links for the implementation

Paper - https://arxiv.org/pdf/2305.07243.pdf
Github repo - https://github.com/neonbjb/tortoise-tts

@sanchit-gandhi @Vaibhavs10

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

Commencez par consulter l’article lié sur Tortoise TTS et l’implémentation de neonbjb/tortoise-tts afin de comprendre le modèle et les poids disponibles, puis comparez-les aux intégrations de pipelines Diffusers existantes. La tâche est considérée comme terminée lorsque Tortoise TTS est disponible en tant que pipeline pris en charge dans Diffusers et que son implémentation ainsi que les attentes d’utilisation sont documentées.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
python, pytorch
Domaine
audio-video-rtc, machine-learning
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
30/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.