Table 4.

Representative voice conversion (VC) generation models

NameModel/approachLanguagesEvaluation metricsYear
Toda et al. (2007) Gaussian mixture model (GMM)EnglishABX test2007
Desai et al. (2009) Artificial neural networks (ANN)EnglishMCD, MOS2009
Nakashika et al. (2013) Deep belief nets (DBNs) + concatenating NNsEnglishNSD2013
AUTOVC (Qian et al., 2019)Autoencoder bottleneck + style transferEnglishMOS2019
Luo et al. (2019) WaveNet-based VCEnglishMCD2019
AlBadawy and Lyu (2020) VAE + GAN with WaveNet vocoder (for synthesis/detection)EnglishEER, WER2020
MaskCycleGAN-VC (Kaneko et al., 2021)Cycle-consistent adversarial training with maskingEnglishMCD, KDSD2021
StarGANv2-VC (Li et al., 2021)GAN-based many-to-many frameworkMultilingualMOS, speaker similarity2021
VQMIVC (Wang et al., 2021)Vector quantization + mutual informationEnglishMOS2021
AVQVC (Tang et al., 2022)Vector quantization + AutoVC principlesEnglishMOS, VSS2022
DRVC (Wang et al., 2022)Disentangled representation VCEnglishMCD, MOS2022
NVC-Net (Nguyen and Cardinaux, 2022)End-to-end adversarial networkEnglishEER, MOS2022
Jia et al. (2023) Pseudo Siamese DisentanglementMultilingualMOS2022
YourTTS (Casanova et al., 2022)Multilingual VITS-based VC/TTSMultilingualMOS, speaker similarity2022
Emotional VC (Zhou et al., 2022)Emotional VC with ESD databaseEnglish and ChineseMOS, ESD benchmarks2022
DDDM-VC (Choi et al., 2023)Diffusion-based disentangled modelingEnglishMOS, CER, WER, EER2023

or Create an Account

Close subscription notice
Close access options