Co-speech Gesture Generation on BEAT-2 (1 Speaker)
7.971BCSynTalker
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SynTalkerCondition Signal=audio, text2024.12 | 7.971 | 6.413 | 12.721 | |
| Language of MotionCondition Signal=audio2024.12 | 7.78 | 5.301 | 15.167 | |
| Language of MotionCondition Signal=audio, multimodal pre-training=false2024.12 | 7.742 | 5.408 | 14.418 | |
| EMAGECondition Signal=audio, text2024.12 | 7.724 | 5.512 | 13.06 | |
| Habibie et al.Condition Signal=audio, text2024.12 | 7.716 | 9.04 | 8.213 | |
| DiffStyleGestureCondition Signal=audio, style2024.12 | 7.241 | 8.811 | 11.49 | |
| TalkSHOWCondition Signal=audio2024.12 | 6.947 | 6.209 | 13.47 | |
| CaMNCondition Signal=audio, text, facial2024.12 | 6.769 | 6.644 | 10.86 | |
| DisCoCondition Signal=audio2024.12 | 6.439 | 9.417 | 9.912 | |
| Language of MotionCondition Signal=audio, language pre-training=false2024.12 | 6.148 | 7.47 | 14.162 | |
| EMAGEspeaker_mode=1 Speaker2025.05 | 0.793 | 0.57 | 11.41 | |
| RAG-Gesturespeaker_mode=1 Speaker2025.05 | 0.73 | 0.879 | 12.62 | |
| GestureLSMspeaker_mode=1 Speaker2025.05 | 0.714 | 0.408 | 13.24 | |
| Ground Truthspeaker_mode=1 Speaker2025.05 | 0.703 | — | 11.97 | |
| Intentional-Gesturespeaker_mode=1 Speaker2025.05 | 0.69 | 0.379 | 11 | |
| CaMNspeaker_mode=1 Speaker2025.05 | 0.676 | 0.604 | 9.97 | |
| Audio2Photorealspeaker_mode=1 Speaker2025.05 | 0.55 | 1.02 | 12.47 |