Representative voice conversion (VC) generation models
| Name | Model/approach | Languages | Evaluation metrics | Year |
|---|---|---|---|---|
| Toda et al. (2007) | Gaussian mixture model (GMM) | English | ABX test | 2007 |
| Desai et al. (2009) | Artificial neural networks (ANN) | English | MCD, MOS | 2009 |
| Nakashika et al. (2013) | Deep belief nets (DBNs) + concatenating NNs | English | NSD | 2013 |
| AUTOVC (Qian et al., 2019) | Autoencoder bottleneck + style transfer | English | MOS | 2019 |
| Luo et al. (2019) | WaveNet-based VC | English | MCD | 2019 |
| AlBadawy and Lyu (2020) | VAE + GAN with WaveNet vocoder (for synthesis/detection) | English | EER, WER | 2020 |
| MaskCycleGAN-VC (Kaneko et al., 2021) | Cycle-consistent adversarial training with masking | English | MCD, KDSD | 2021 |
| StarGANv2-VC (Li et al., 2021) | GAN-based many-to-many framework | Multilingual | MOS, speaker similarity | 2021 |
| VQMIVC (Wang et al., 2021) | Vector quantization + mutual information | English | MOS | 2021 |
| AVQVC (Tang et al., 2022) | Vector quantization + AutoVC principles | English | MOS, VSS | 2022 |
| DRVC (Wang et al., 2022) | Disentangled representation VC | English | MCD, MOS | 2022 |
| NVC-Net (Nguyen and Cardinaux, 2022) | End-to-end adversarial network | English | EER, MOS | 2022 |
| Jia et al. (2023) | Pseudo Siamese Disentanglement | Multilingual | MOS | 2022 |
| YourTTS (Casanova et al., 2022) | Multilingual VITS-based VC/TTS | Multilingual | MOS, speaker similarity | 2022 |
| Emotional VC (Zhou et al., 2022) | Emotional VC with ESD database | English and Chinese | MOS, ESD benchmarks | 2022 |
| DDDM-VC (Choi et al., 2023) | Diffusion-based disentangled modeling | English | MOS, CER, WER, EER | 2023 |
| Name | Model/approach | Languages | Evaluation metrics | Year |
|---|---|---|---|---|
| Gaussian mixture model ( | English | 2007 | ||
| Artificial neural networks ( | English | MCD, | 2009 | |
| Deep belief nets (DBNs) + concatenating NNs | English | 2013 | ||
| Autoencoder bottleneck + style transfer | English | 2019 | ||
| WaveNet-based | English | 2019 | ||
| English | EER, | 2020 | ||
| MaskCycleGAN-VC ( | Cycle-consistent adversarial training with masking | English | MCD, | 2021 |
| StarGANv2-VC ( | GAN-based many-to-many framework | Multilingual | MOS, speaker similarity | 2021 |
| Vector quantization + mutual information | English | 2021 | ||
| Vector quantization + AutoVC principles | English | MOS, | 2022 | |
| Disentangled representation | English | MCD, | 2022 | |
| NVC-Net ( | End-to-end adversarial network | English | EER, | 2022 |
| Pseudo Siamese Disentanglement | Multilingual | 2022 | ||
| YourTTS ( | Multilingual VITS-based VC/TTS | Multilingual | MOS, speaker similarity | 2022 |
| Emotional | Emotional | English and Chinese | MOS, | 2022 |
| DDDM-VC ( | Diffusion-based disentangled modeling | English | MOS, CER, WER, | 2023 |
Sharing content requires targeting cookies to be enabled. Please update your cookie preferences to use this feature.