Intelligibility evaluation results (CER and WER in %) on speech synthesized from models trained under seven different transcription conditions
| Training conditions | Clean | WER-070 | WER-162 | WER-242 | WER-358 | WER-437 | WER-548 | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Models / (%) | CER | WER | CER | WER | CER | WER | CER | WER | CER | WER | CER | WER | CER | WER |
| Tacotron 2 | 3.3 | 7.6 | 6.1 | 10.9 | 7.1 | 13.1 | 11.2 | 19.5 | 11.5 | 22.5 | 17.7 | 28.7 | 27.7 | 45.3 |
| Vits | 3.4 | 6.8 | 4.1 | 8.2 | 5.1 | 10.3 | 7.3 | 14.1 | 11.9 | 21.9 | 17.8 | 31.6 | 27.9 | 46.7 |
| GradTTS | 3.4 | 7.0 | 3.7 | 7.6 | 4.0 | 8.6 | 4.3 | 8.7 | 5.2 | 10.6 | 6.9 | 14.0 | 8.9 | 16.5 |
| Dvt | 3.3 | 6.9 | 3.6 | 7.4 | 4.4 | 8.9 | 4.9 | 9.3 | 5.4 | 10.9 | 6.5 | 12.8 | 7.4 | 13.9 |
| Dvt2 | 3.2 | 6.8 | 3.3 | 7.4 | 4.1 | 8.4 | 4.2 | 8.6 | 4.4 | 9.6 | 5.6 | 10.8 | 6.9 | 13.2 |
| Vits-dp | 3.1 | 7.0 | 3.6 | 7.6 | 4.1 | 8.6 | 5.9 | 10.9 | 8.2 | 15.2 | 12.3 | 22.0 | 19.3 | 33.6 |
| Training conditions | Clean | WER-070 | WER-162 | WER-242 | WER-358 | WER-437 | WER-548 | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Models / (%) | ||||||||||||||
| Tacotron 2 | 3.3 | 7.6 | 6.1 | 10.9 | 7.1 | 13.1 | 11.2 | 19.5 | 11.5 | 22.5 | 17.7 | 28.7 | 27.7 | 45.3 |
| Vits | 3.4 | 6.8 | 4.1 | 8.2 | 5.1 | 10.3 | 7.3 | 14.1 | 11.9 | 21.9 | 17.8 | 31.6 | 27.9 | 46.7 |
| GradTTS | 3.4 | 7.0 | 3.7 | 7.6 | 8.6 | 4.3 | 8.7 | 5.2 | 10.6 | 6.9 | 14.0 | 8.9 | 16.5 | |
| Dvt | 3.3 | 6.9 | 3.6 | 7.4 | 4.4 | 8.9 | 4.9 | 9.3 | 5.4 | 10.9 | 6.5 | 12.8 | 7.4 | 13.9 |
| Dvt2 | 3.2 | 6.8 | 4.1 | |||||||||||
| Vits-dp | 3.1 | 7.0 | 3.6 | 7.6 | 4.1 | 8.6 | 5.9 | 10.9 | 8.2 | 15.2 | 12.3 | 22.0 | 19.3 | 33.6 |
Sharing content requires targeting cookies to be enabled. Please update your cookie preferences to use this feature.