Speech Quality Test Results: MUSHRA naturalness scores with 95% confidence interval and Word Error Rate (WER). The column “GT or Pred” indicates whether we use ground-truth hierarchical ED (“GT”) or a text-predicted version. In the “TTS Model” column, “VA” and “VA(Multi-Step)” denote the TTS models employing the Single-Step hierarchical ED Variance Adaptor (Figure 4(d)) and the Multi-Step hierarchical ED Variance Adaptor (Figure 4(b)), respectively. Finally, the “Pred Mode” column specifies whether we predict the hierarchical ED sequentially from longer to shorter segments (Multi-Step) or in parallel for all segments (Single-Step)
| Hierarchical ED | Speech Quality | |||
|---|---|---|---|---|
| GT or Pred | TTS Model | Pred Mode | MUSHRA () | WER () |
| — Ground-Truth Speech Samples — | 79.4 1.9 | 2.16 | ||
| GT | External | – | 61.6 2.2 | 3.37 |
| GT | VA | – | 57.5 2.6 | 3.11 |
| GT | VA(Multi-Step) | – | 62.2 2.3 | 2.48 |
| Predicted | External | Single-Step | 50.7 2.4 | 3.80 |
| Predicted | External | Multi-Step | 54.0 2.3 | 3.25 |
| Predicted | VA | Single-Step | 52.2 2.6 | 4.61 |
| Predicted | VA(Multi-Step) | Multi-Step | 53.2 2.4 | 2.45 |
| Hierarchical | Speech Quality | |||
|---|---|---|---|---|
| Pred Mode | ||||
| — Ground-Truth Speech Samples — | 79.4 | 2.16 | ||
| External | – | 61.6 | 3.37 | |
| – | 57.5 | 3.11 | ||
| VA(Multi-Step) | – | |||
| Predicted | External | Single-Step | 50.7 | 3.80 |
| Predicted | External | Multi-Step | ||
| Predicted | Single-Step | 52.2 | 4.61 | |
| Predicted | VA(Multi-Step) | Multi-Step | ||
Sharing content requires targeting cookies to be enabled. Please update your cookie preferences to use this feature.