Representative text-to-speech (TTS) generation models
| Name | Model/approach | Languages | Adaptation ability | Evaluation metrics | Year |
|---|---|---|---|---|---|
| Concatenative TTS (Hunt and Black, 1996) | Unit selection (diphones, syllables) | Single language | None | Intelligibility tests | 1996 |
| HMM/GMM TTS (Tokuda et al., 2000; Zen et al., 2009) | Statistical parametric synthesis | Single language | Limited (speaker-dependent) | MOS, MCD | 2000 |
| Char2Wav (Sotelo et al., 2017) | Seq2Seq + WaveNet vocoder | English | Fine-tuning | MOS, ABX | 2017 |
| Tacotron (Wang et al., 2017) | Attention-based Seq2Seq + Griffin-Lim/WaveNet vocoder | English | Fine-tuning | MOS, spectrogram analysis | 2017 |
| WaveNet (van den Oord et al., 2016) | Autoregressive generative vocoder | English | None | MOS, NLL | 2016 |
| Tacotron 2 (Shen et al., 2018) | Seq2Seq + WaveNet vocoder | English | Fine-tuning | MOS | 2018 |
| FastSpeech (Ren et al., 2019) | Feed-forward transformer | English | Limited (fine-tuning required) | MOS, MCD | 2019 |
| Glow-TTS (Kim et al., 2020) | Flow-based generative model | English | Limited (fine-tuning required) | MOS, speaker similarity | 2020 |
| FastSpeech 2 (Ren et al., 2021a) | Enhanced variance modeling | English | Limited (fine-tuning required) | MOS, speaker similarity | 2020 |
| VITS (Kim et al., 2021) | End-to-end variational inference + adversarial learning | English | Few-shot | MOS, speaker similarity, CER | 2021 |
| PortaSpeech (Ren et al., 2021b) | Variational inference + normalizing flow | English | Few-shot | MOS, CER | 2021 |
| Meta-StyleSpeech (Min et al., 2021) | Meta-learning for speaker adaptation | English | Few-shot | MOS | 2021 |
| NaturalSpeech (Shen et al., 2022) | Diffusion probabilistic model | English | Few-shot | MOS, CER | 2022 |
| YourTTS (Casanova et al., 2022) | Multilingual VITS-based | Multilingual | Zero-shot (cross-lingual) | MOS, speaker similarity | 2022 |
| VALL-E (Wang et al., 2023) | Neural codec language model | English | Zero-shot | MOS, speaker similarity | 2023 |
| NaturalSpeech 2 (Shen et al., 2023) | Latent diffusion modeling | English | Zero-shot | MOS, CER | 2023 |
| StyleTTS 2 (Kim et al., 2023b) | Diffusion + adversarial training | English | Zero-shot (style transfer) | MOS, speaker similarity | 2023 |
| BASE TTS (Łajszczak et al., 2024) | Large autoregressive transformer | Multilingual | Few-shot | MOS, speaker similarity, WER | 2024 |
| VALL-E 2 (Chen et al., 2024) | Improved neural codec LM | English | Zero-shot | MOS, speaker similarity, inference speed | 2024 |
| NaturalSpeech 3 (Ju et al., 2024) | Factorized diffusion + codec modeling | Multilingual | Zero-shot | MOS, speaker similarity | 2024 |
| MaskGCT (Wang et al., 2024) | Masked codec-based transformer | Multilingual | Zero-shot | MOS, inference efficiency | 2024 |
| CLaM-TTS (Kim et al., 2024) | Residual vector quantization codec model | Multilingual | Zero-shot | MOS, speaker similarity | 2024 |
| CM-TTS (Li et al., 2024) | Consistency model for fast inference | Multilingual | Zero-shot | MOS, inference speed (RTF) | 2024 |
| XTTS (Casanova et al., 2024) | Multilingual zero-shot TTS | Multilingual | Zero-shot | MOS, speaker similarity | 2024 |
| SupertonicTTS (Kim et al., 2025) | Flow-matching-based latent diffusion TTS | English | Few-shot | MOS, CER | 2025 |
| VITA-Audio (Long et al., 2025) | Interleaved token generation with MCTP | English | None | MOS, inference speed (RTF) | 2025 |
| DiFlow-TTS (Nguyen et al., 2025) | Discrete flow matching (factorized tokens) | English | Zero-shot | MOS, WER, RTF | 2025 |
| Name | Model/approach | Languages | Adaptation ability | Evaluation metrics | Year |
|---|---|---|---|---|---|
| Concatenative | Unit selection (diphones, syllables) | Single language | None | Intelligibility tests | 1996 |
| HMM/ | Statistical parametric synthesis | Single language | Limited (speaker-dependent) | MOS, | 2000 |
| Char2Wav ( | Seq2Seq + WaveNet vocoder | English | Fine-tuning | MOS, | 2017 |
| Tacotron ( | Attention-based Seq2Seq + Griffin-Lim/WaveNet vocoder | English | Fine-tuning | MOS, spectrogram analysis | 2017 |
| WaveNet ( | Autoregressive generative vocoder | English | None | MOS, | 2016 |
| Tacotron 2 ( | Seq2Seq + WaveNet vocoder | English | Fine-tuning | 2018 | |
| FastSpeech ( | Feed-forward transformer | English | Limited (fine-tuning required) | MOS, | 2019 |
| Glow-TTS ( | Flow-based generative model | English | Limited (fine-tuning required) | MOS, speaker similarity | 2020 |
| FastSpeech 2 ( | Enhanced variance modeling | English | Limited (fine-tuning required) | MOS, speaker similarity | 2020 |
| End-to-end variational inference + adversarial learning | English | Few-shot | MOS, speaker similarity, | 2021 | |
| PortaSpeech ( | Variational inference + normalizing flow | English | Few-shot | MOS, | 2021 |
| Meta-StyleSpeech ( | Meta-learning for speaker adaptation | English | Few-shot | 2021 | |
| NaturalSpeech ( | Diffusion probabilistic model | English | Few-shot | MOS, | 2022 |
| YourTTS ( | Multilingual VITS-based | Multilingual | Zero-shot (cross-lingual) | MOS, speaker similarity | 2022 |
| VALL-E ( | Neural codec language model | English | Zero-shot | MOS, speaker similarity | 2023 |
| NaturalSpeech 2 ( | Latent diffusion modeling | English | Zero-shot | MOS, | 2023 |
| StyleTTS 2 ( | Diffusion + adversarial training | English | Zero-shot (style transfer) | MOS, speaker similarity | 2023 |
| Large autoregressive transformer | Multilingual | Few-shot | MOS, speaker similarity, | 2024 | |
| VALL-E 2 ( | Improved neural codec | English | Zero-shot | MOS, speaker similarity, inference speed | 2024 |
| NaturalSpeech 3 ( | Factorized diffusion + codec modeling | Multilingual | Zero-shot | MOS, speaker similarity | 2024 |
| MaskGCT ( | Masked codec-based transformer | Multilingual | Zero-shot | MOS, inference efficiency | 2024 |
| CLaM-TTS ( | Residual vector quantization codec model | Multilingual | Zero-shot | MOS, speaker similarity | 2024 |
| CM-TTS ( | Consistency model for fast inference | Multilingual | Zero-shot | MOS, inference speed ( | 2024 |
| Multilingual zero-shot | Multilingual | Zero-shot | MOS, speaker similarity | 2024 | |
| SupertonicTTS ( | Flow-matching-based latent diffusion | English | Few-shot | MOS, | 2025 |
| VITA-Audio ( | Interleaved token generation with | English | None | MOS, inference speed ( | 2025 |
| DiFlow-TTS ( | Discrete flow matching (factorized tokens) | English | Zero-shot | MOS, WER, | 2025 |
Sharing content requires targeting cookies to be enabled. Please update your cookie preferences to use this feature.