Expressive Speech-to-Speech Translation on NonverbalTTS
0.55Aro-Val SIMCascaded
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CascadedOne-shot acoustic prompt=true2026.04 | 0.55 | 2.61 | 3.43 | 26 | |
| MoVE2026.04 | 0.53 | 3.85 | 3.79 | 76 | |
| Kimi + LoRATraining data source=Ours, Training duration (hours)=100h2026.04 | 0.51 | — | — | 26 | |
| Kimi + LoRATraining data source=Ours, Training duration (hours)=50h2026.04 | 0.49 | — | — | — | |
| SeamlessExpressive2026.04 | 0.45 | 1.41 | 2.57 | 14 | |
| Kimi + LoRATraining data source=SynStard, Training duration (hours)=100h2026.04 | 0.39 | — | — | — | |
| gpt-4o-audio-preview2026.04 | 0.18 | 2.87 | 1.95 | 2 | |
| Kimi + LoRATraining data source=SeamlessAlign, Training duration (hours)=67h2026.04 | 0.18 | — | — | — | |
| SeamlessM4T-Large-v22026.04 | 0.14 | 1.65 | 1.47 | 2 | |
| Kimi-Audio-7B-Instruct2026.04 | 0.11 | 3.26 | 2.03 | 4 |