Co-speech gesture generation on SuSuInterActs (test)
62.2R@1Real Motion
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Real MotionCondition=—2026.04 | 62.2 | 73.56 | 78.7 | 0 | 0.308 | 22.61 | |
| SentiAvatarCondition=Audio, Text, Backbone=Qwen-0.5B2026.04 | 43.64 | 54.94 | 61.84 | 8.912 | 0.456 | 22.41 | |
| MoMaskCondition=Text2026.04 | 34.55 | 46.58 | 54.29 | 36.25 | 0.471 | 22.03 | |
| AT2M-GPTCondition=Audio, Text, Token-by-token autoregressive generation=true, Backbone=Qwen-0.5B2026.04 | 27.52 | 36.11 | 41.38 | 18.491 | 0.503 | 22.36 | |
| T2M-GPTCondition=Text2026.04 | 23.12 | 30.49 | 35.43 | 67.78 | 0.721 | 20.65 | |
| A2M-GPTCondition=Audio, Token-by-token autoregressive generation=true, Backbone=Qwen-0.5B2026.04 | 8.72 | 15.96 | 20.08 | 13.66 | 0.477 | 22.23 | |
| HunYuan-MotionCondition=Text2026.04 | 5.21 | 8.59 | 11.9 | 352.56 | 0.708 | 16.92 | |
| EMAGECondition=Audio2026.04 | 5 | 9.4 | 13.32 | 441.6 | 0.606 | 12.92 |