Table 5.

Representative voice cloning and zero/few-shot TTS models

NameModel/approachCloning typeEvaluation metrics (as reported)Year
Tacotron 2 + WaveNet (Shen et al., 2018)Seq2Seq acoustic model + autoregressive vocoderFine-tuning (speaker adaptation)MOS, speaker similarity (Sim)2018
d-vector TTS (Jia et al., 2018)Speaker embeddings (d-vector) + Tacotron 2Few-shotMOS, speaker similarity (Sim)2018
x-vector TTS (Wan et al., 2018)x-vector embeddings + neural vocoderFew-shotMOS, speaker similarity (Sim)2018
AdaSpeech (Chen et al., 2021)Adaptive TTS with meta-learningFew-shotMOS, Mel Cepstral Distortion (MCD)2021
Meta-StyleSpeech (Min et al., 2021)Meta-learning + style adaptationFew-shotMOS, speaker similarity (Sim)2021
YourTTS (Casanova et al., 2022)VITS-based, multilingual + adversarial trainingZero-shotMOS, speaker similarity (Sim)2022
ProDiff (Huang et al., 2022)Progressive fast diffusion modelMulti-speaker TTSMOS, real-time factor (RTF)2022
DiffGAN-TTS (Liu et al., 2022)Diffusion + adversarial trainingMulti-speaker TTSMOS, speaker similarity (Sim)2022
VALL-E (Wang et al., 2023)Neural codec language modelZero-shotMOS, speaker similarity (Sim)2023
NaturalSpeech 2 (Shen et al., 2023)Diffusion-based TTSZero-shotMOS, CER/WER, speaker similarity (Sim)2023
UnitSpeech (Kim et al., 2023a)Discrete units + diffusion modelingFew-shot/zero-shotMOS, speaker similarity (Sim)2023
XTTS (Casanova et al., 2023)VQ-VAE + GPT + diffusion decoderZero-shotMOS, speaker similarity (Sim)2023
ElevenLabs (2023) Commercial neural TTS systemZero-shotMOS (reported)2023
NaturalSpeech 3 (Ju et al., 2024)Factorized codec + diffusion modelingZero-shotMOS, WER, speaker similarity (Sim)2024
VALL-E 2 (Chen et al., 2024)Improved codec-based transformer (successor of VALL-E)Zero-shotMOS, speaker similarity (Sim)2024

or Create an Account

Close subscription notice
Close access options