Motion Captioning on HumanML3D (22 joints SMPL, test)
11.6R@1SkeletonLLM
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| SkeletonLLMTraining Source=NTU-60 (Kinect v2, 25 joints), Supervision=recognition, Finetuning=none, Cross-format transfer=Kinect v2 to SMPL2026.03 | 11.6 | 28.56 | 5.94 | 9.63 | 39.84 | 18.25 | 37.28 | |
| InternVL3-8BTraining Source=NTU-60 (Kinect v2, 25 joints), Supervision=recognition, Finetuning=none, Cross-format transfer=Kinect v2 to SMPL2026.03 | 6.25 | 20.08 | 6.36 | 7.15 | 27.01 | 9.49 | 29.45 | |
| MotionLLMTraining Source=NTU-60 (Kinect v2, 25 joints), Supervision=recognition, Finetuning=none, Cross-format transfer=Kinect v2 to SMPL2026.03 | 4.9 | 14.34 | 9.67 | 5.57 | 19.72 | 5.08 | 23.44 | |
| MotionGPTTraining Source=NTU-60 (Kinect v2, 25 joints), Supervision=recognition, Finetuning=none, Cross-format transfer=Kinect v2 to SMPL2026.03 | 2.83 | 9.86 | 12.27 | 3.5 | 13.83 | 4.16 | 14.03 |