Text-to-Motion Synthesis on HumanML3D
78.6R-Precision (Top 1)TriC-Motion
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| TriC-MotionEvaluator=CLaM2026.02 | 78.6 | — | — | — | — | — | — | 91.2 | 95.2 | |
| SALADEvaluator=CLaM2026.02 | 77.6 | — | — | — | — | — | — | 90.2 | 94.3 | |
| GTEvaluator=CLaM2026.02 | 73.8 | — | — | — | — | — | — | 87 | 91.7 | |
| MoMaskEvaluator=CLaM2026.02 | 71.5 | — | — | — | — | — | — | 85.6 | 90.9 | |
| HumanML3D2026.02 | 70.2 | 27.492 | — | — | — | — | 15.151 | 86.4 | 91.4 | |
| T2M-GPTEvaluator=CLaM2026.02 | 67.6 | — | — | — | — | — | — | 82 | 87.8 | |
| MotionDiffuseEvaluator=CLaM2026.02 | 64.5 | — | — | — | — | — | — | 80.3 | 86.8 | |
| MotionStreamerTraining Data Scale=Only HumanML3D2026.02 | 63.1 | 27.284 | — | — | — | 11.79 | 16.081 | 80.2 | 85.9 | |
| MoMaskTraining Data Scale=Only HumanML3D2026.02 | 62.1 | 27.127 | — | — | — | 12.232 | 16.138 | 78.4 | 84.6 | |
| MotionMillion-7BTraining Data Scale=Large Scale Dataset, Model Scale=7B2026.02 | 61.6 | 26.829 | — | — | — | 23.582 | 16.938 | 75.2 | 81.9 | |
| T2M-GPTTraining Data Scale=Only HumanML3D2026.02 | 60.6 | 27.275 | — | — | — | 12.475 | 16.812 | 77.4 | 83.8 | |
| LLaMo-3BTraining Data Scale=Large Scale Dataset, Model Scale=3B2026.02 | 60.6 | 27.582 | — | — | — | 22.491 | 17.057 | 76.6 | 83.9 | |
| MotionMillion-3BTraining Data Scale=Large Scale Dataset, Model Scale=3B2026.02 | 60.2 | 26.634 | — | — | — | 23.755 | 16.995 | 74.9 | 81.7 | |
| MLDEvaluator=CLaM2026.02 | 59.9 | — | — | — | — | — | — | 76 | 83.1 | |
| AttT2MTraining Data Scale=Only HumanML3D2026.02 | 59.2 | 26.674 | — | — | — | 15.428 | 15.726 | 76.5 | 83.4 | |
| T2MEvaluator=CLaM2026.02 | 57.7 | — | — | — | — | — | — | 73 | 80.4 | |
| MotionGPT32026.02 | 55.3 | 9.7 | 1.018 | — | — | 0.208 | 2.725 | 74.7 | 83.7 | |
| MoTe2026.02 | 54.8 | — | 2.399 | — | — | 0.075 | 2.867 | 73.7 | 82.5 | |
| MLDTraining Data Scale=Only HumanML3D2026.02 | 54.6 | 26.352 | — | — | — | 18.236 | 16.638 | 73 | 79.2 | |
| LLaMo-1BTraining Data Scale=Large Scale Dataset, Model Scale=1B2026.02 | 54.1 | 26.846 | — | — | — | 53.942 | 18.215 | 68.9 | 76.1 | |
| IRMoGen (S3)Framework=VQ+Gemma2-2B, w/ GRPO=true, support_multimodal_output=true2025.12 | 53.5 | 9.9 | — | — | — | 0.242 | 2.785 | 72.5 | 82 | |
| DiMoOptimization strategy=w/o GRPO2026.02 | 52.8 | 9.515 | 2.016 | — | — | 0.05 | 2.867 | 72.3 | 81.8 | |
| DiMoOptimization strategy=w/ GRPO2026.02 | 52.8 | 9.419 | 2 | — | — | 0.047 | 2.862 | 72.4 | 81.8 | |
| IRMoGen (S2)Framework=VQ+Gemma2-2B, w/ GRPO=false, support_multimodal_output=true2025.12 | 52.6 | 9.819 | — | — | — | 0.111 | 2.885 | 71.7 | 81 | |
| MDMTraining Data Scale=Only HumanML3D2026.02 | 52.3 | 26.325 | — | — | — | 23.454 | 17.423 | 69.2 | 76.4 | |
| IRMoGen (S1)Framework=VQ+Gemma2-2B, w/ GRPO=false, support_multimodal_output=true2025.12 | 52.2 | 9.74 | — | — | — | 0.135 | 2.906 | 71.1 | 80.5 | |
| MG-MotionLLM2026.02 | 51.6 | 9.96 | 2.125 | — | — | 0.303 | 2.952 | 70.6 | 80.2 | |
| MG-MotionLLMFramework=VQ+T5, w/ GRPO=false, support_multimodal_output=true2025.12 | 51.6 | 9.96 | — | — | — | 0.303 | 2.952 | 70.6 | 80.2 | |
| MotionLLMFramework=VQ+Gemma2-2B, w/ GRPO=false2025.12 | 51.5 | 9.908 | — | — | — | 0.23 | 2.967 | 69.1 | 80.1 | |
| Motion-R1Framework=VQ+Qwen2.5-3B, w/ GRPO=true, support_multimodal_output=true2025.12 | 51.5 | 10.026 | — | — | — | 0.201 | 2.854 | 71.9 | 81.8 | |
| Real motions2026.02 | 51.1 | 9.503 | — | — | — | 0.002 | 2.974 | 70.3 | 79.7 | |
| MotionChainFramework=VQ+T5, w/ GRPO=false, support_multimodal_output=true2025.12 | 50.4 | 9.47 | — | — | — | 0.248 | 3.033 | 61.7 | 79 | |
| MotionGPT-2Framework=VQ+LLaMA3.1-8B, w/ GRPO=false, support_multimodal_output=true2025.12 | 49.6 | 9.86 | — | — | — | 0.191 | 3.08 | 69.1 | 78.2 | |
| MotionLLMFramework=VQ+Gemma2-2B, w/ GRPO=false, weights=official2025.12 | 49.6 | 9.864 | — | — | — | 0.198 | 3.029 | 68.4 | 78.2 | |
| MotionGPT2026.02 | 49.2 | 9.528 | 2.008 | — | — | 0.232 | 3.096 | 68.1 | 77.8 | |
| T2M-GPTFramework=VQ+GPT2, w/ GRPO=false2025.12 | 49.2 | 9.722 | — | — | — | 0.141 | 3.121 | 67.9 | 77.5 | |
| MotionGPTFramework=VQ+T5, w/ GRPO=false, support_multimodal_output=true2025.12 | 49.2 | 9.528 | — | — | — | 0.232 | 3.096 | 68.1 | 73.3 | |
| MotionGPTEvaluator=CLaM2026.02 | 47.8 | — | — | — | — | — | — | 65.5 | 75.2 | |
| MotionGPTTraining Data Scale=Only HumanML3D2026.02 | 45.6 | 27.114 | — | — | — | 14.375 | 17.892 | 59.8 | 62.8 | |
| ViMoRAGFramework=VQ+Phi3-3.8B, w/ GRPO=false2025.12 | 45.2 | 9.424 | — | — | — | 0.131 | 3.146 | 65.5 | 76.4 | |
| MotionGPT-2Framework=VQ+Gemma-2B, w/ GRPO=false, support_multimodal_output=true2025.12 | 43.6 | 10.081 | — | — | — | 0.228 | 3.589 | 60 | 69.7 | |
| MotionGPT22026.02 | 42.7 | 11.256 | 2.357 | — | — | 0.614 | 3.164 | 62.7 | 76.4 | |
| TM2T2026.02 | 42.4 | 8.589 | 2.424 | — | — | 1.501 | 3.467 | 61.8 | 72.9 | |
| AttT2MPredict Length=true, Input Length=false, Edit=false2024.03 | — | — | — | — | 49.9 | 0.112 | 3.038 | — | — | |
| BAMMPredict Length=true, Input Length=true, Edit=true2024.03 | — | — | — | — | 52.5 | 0.055 | 2.919 | — | — | |
| Dance2Music2022.12 | — | 0.725 | 0.043 | 9.7 | — | — | — | — | — | |
| Guo et al.2022.12 | — | 9.188 | 2.09 | 74 | — | — | — | — | — | |
| Language2Pose2022.12 | — | 7.676 | — | 48.6 | — | — | — | — | — | |
| MMMPredict Length=false, Input Length=true, Edit=true2024.03 | — | — | — | — | 50.4 | 0.08 | 2.998 | — | — | |
| MoCoGAN2022.12 | — | 0.462 | 0.019 | 10.6 | — | — | — | — | — | |
| MoFusion2022.12 | — | 8.82 | 2.521 | 49.2 | — | — | — | — | — | |
| MoMaskPredict Length=false, Input Length=true, Edit=true2024.03 | — | — | — | — | 52.2 | 0.09 | 2.945 | — | — | |
| Real Motions2022.12 | — | 9.503 | — | 79.7 | — | — | — | — | — | |
| T2M-GPTPredict Length=true, Input Length=false, Edit=false2024.03 | — | — | — | — | 49.1 | 0.116 | 3.118 | — | — | |
| Text2Gesture2022.12 | — | 6.409 | — | 34.5 | — | — | — | — | — |