Table 3.

Representative text-to-speech (TTS) generation models

NameModel/approachLanguagesAdaptation abilityEvaluation metricsYear
Concatenative TTS (Hunt and Black, 1996)Unit selection (diphones, syllables)Single languageNoneIntelligibility tests1996
HMM/GMM TTS (Tokuda et al., 2000; Zen et al., 2009)Statistical parametric synthesisSingle languageLimited (speaker-dependent)MOS, MCD2000
Char2Wav (Sotelo et al., 2017)Seq2Seq + WaveNet vocoderEnglishFine-tuningMOS, ABX2017
Tacotron (Wang et al., 2017)Attention-based Seq2Seq + Griffin-Lim/WaveNet vocoderEnglishFine-tuningMOS, spectrogram analysis2017
WaveNet (van den Oord et al., 2016)Autoregressive generative vocoderEnglishNoneMOS, NLL2016
Tacotron 2 (Shen et al., 2018)Seq2Seq + WaveNet vocoderEnglishFine-tuningMOS2018
FastSpeech (Ren et al., 2019)Feed-forward transformerEnglishLimited (fine-tuning required)MOS, MCD2019
Glow-TTS (Kim et al., 2020)Flow-based generative modelEnglishLimited (fine-tuning required)MOS, speaker similarity2020
FastSpeech 2 (Ren et al., 2021a)Enhanced variance modelingEnglishLimited (fine-tuning required)MOS, speaker similarity2020
VITS (Kim et al., 2021)End-to-end variational inference + adversarial learningEnglishFew-shotMOS, speaker similarity, CER2021
PortaSpeech (Ren et al., 2021b)Variational inference + normalizing flowEnglishFew-shotMOS, CER2021
Meta-StyleSpeech (Min et al., 2021)Meta-learning for speaker adaptationEnglishFew-shotMOS2021
NaturalSpeech (Shen et al., 2022)Diffusion probabilistic modelEnglishFew-shotMOS, CER2022
YourTTS (Casanova et al., 2022)Multilingual VITS-basedMultilingualZero-shot (cross-lingual)MOS, speaker similarity2022
VALL-E (Wang et al., 2023)Neural codec language modelEnglishZero-shotMOS, speaker similarity2023
NaturalSpeech 2 (Shen et al., 2023)Latent diffusion modelingEnglishZero-shotMOS, CER2023
StyleTTS 2 (Kim et al., 2023b)Diffusion + adversarial trainingEnglishZero-shot (style transfer)MOS, speaker similarity2023
BASE TTS (Łajszczak et al., 2024)Large autoregressive transformerMultilingualFew-shotMOS, speaker similarity, WER2024
VALL-E 2 (Chen et al., 2024)Improved neural codec LMEnglishZero-shotMOS, speaker similarity, inference speed2024
NaturalSpeech 3 (Ju et al., 2024)Factorized diffusion + codec modelingMultilingualZero-shotMOS, speaker similarity2024
MaskGCT (Wang et al., 2024)Masked codec-based transformerMultilingualZero-shotMOS, inference efficiency2024
CLaM-TTS (Kim et al., 2024)Residual vector quantization codec modelMultilingualZero-shotMOS, speaker similarity2024
CM-TTS (Li et al., 2024)Consistency model for fast inferenceMultilingualZero-shotMOS, inference speed (RTF)2024
XTTS (Casanova et al., 2024)Multilingual zero-shot TTSMultilingualZero-shotMOS, speaker similarity2024
SupertonicTTS (Kim et al., 2025)Flow-matching-based latent diffusion TTSEnglishFew-shotMOS, CER2025
VITA-Audio (Long et al., 2025)Interleaved token generation with MCTPEnglishNoneMOS, inference speed (RTF)2025
DiFlow-TTS (Nguyen et al., 2025)Discrete flow matching (factorized tokens)EnglishZero-shotMOS, WER, RTF2025

or Create an Account

Close subscription notice
Close access options