Gesture-to-Speech Synthesis on PATS
81.48Speech QualityGesture2Speech (Multimodal MoE)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gesture2Speech (Multimodal MoE)Model Variant=Multimodal MoE2026.03 | 81.48 | 79.35 | |
| Gesture2Speech (XTTS v2)Model Variant=XTTS v22026.03 | 75.79 | 72.78 | |
| Gesture2Speech (H-MoE)Model Variant=H-MoE2026.03 | 73.55 | 71.54 | |
| Gesture2Speech (Unimodal MoE)Model Variant=Unimodal MoE2026.03 | 72.22 | 71.59 | |
| Gesture2Speech (GPT-SoVITS)Model Variant=GPT-SoVITS2026.03 | 70.78 | 67.89 |