带音高的特征集实验
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 20/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Stack tecnologico
- python
- Ambito
- audio-video-rtc, machine-learning
Direzione di ricerca
Il report descrive un esperimento basato su un fork che modifica le feature v2 da 768 a 769 dimensioni aggiungendo il pitch. Inizia esaminando il fork e i percorsi di estrazione e matching delle feature del repository; confronta il risultato con il pitch con l’originale usando dati di canto. Per considerarlo completato sarebbero necessari un ambito di implementazione definito e prove che il compromesso sulla qualità sia accettabile.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
开发者们好,我想介绍一下我在我的fork(https://github.com/matthew99a/Retrieval-based-Voice-Conversion-WebUI)上做的一个实验。
我用自己很喜欢的一个偏美声歌手训练的模型,最开始听起来不是很像。然后我发现了一个现象:这个歌声在发同一个元音的时候,高音的发音方式和低音的发音方式会不同(比如高音的ah(啊)听感在ah和oo(乌)之间),而HuBERT模型是不能准确的把它们识别成同一种特征的。我因此意识到模型不准确的原因可能是因为模型里训练的特征是不考虑音高的。这样的实现方式在匹配的时候,高音的特征可能与训练集里的低音特征匹配。由于美声歌手往往不会用这个特征唱高音,因此生成出来的高音也会很奇怪。
在我的实验中,我把特征加了一维(v2版本的768维变769维)表示音高,从而使得匹配的时候能够优先匹配训练集里音高接近的特征。使用两个小时的训练集重新训练特征之后,在我的实验中效果好了一大截,当然代价是咬字略微差了一些。当然我也清楚这样做的坏处是训练集要求太高,因为如果训练集太小,可以用来匹配的音高接近的特征就很少,对咬字的牺牲就会很大,并且也许这种实现只有对美声歌手等特殊的唱法非常有效果(不是很清楚一般的流行唱法的高音和低音HuBERT特征差距多大)。
希望这个实验报告能起到一些抛砖引玉的作用。
- Lingua principale
- Python
- Stelle
- 38.4k
- Fork
- 5.3k
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di RVC-Project/Retrieval-based-Voice-Conversion-WebUI
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
-
add git clone into README Aperta
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 85/100
RVC-Project/Retrieval-based-Voice-Conversion-WebUI#2831 · 1 commento ·
-
audio field Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 65/100
-
matplotlib Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 65/100
-
README.md命令拼写错误 Aperta
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 68/100
Tutte le issue di RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 74/100
bancolombia/sentinel#23 ·
-
test md ApertaCI
Difficoltà 2/5 1-3 ore Idoneità per principianti 74/100
-
integration:quickjs org:external priority:backlog topic:code-interpreter topic:middleware type:feature
Difficoltà 2/5 1-3 ore Idoneità per principianti 74/100
langchain-ai/deepagents#6450 ·
-
bug client
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 74/100