Text-to-Pose on MotionVid 50K samples 1.0
149.007FIDMotionDiT
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| MotionDiTTask Adaptation=2D poses, Training Data=MotionVid subset, Backbone=MotionDiT (13 layers), Text Encoder=SD2.1 CLIP2025.03 | 149.007 | 0.451 | 0.638 | 0.743 | 68.22 | 32.761 | 60.46 | |
| MLDTask Adaptation=2D poses, Training Data=MotionVid subset2025.03 | 396.949 | 0.318 | 0.505 | 0.628 | 64.442 | 40.196 | 57.862 | |
| T2M-GPTTask Adaptation=2D poses, Training Data=MotionVid subset2025.03 | 496.907 | 0.176 | 0.299 | 0.395 | 64 | 42.95 | 14.48 | |
| PriorMDMTask Adaptation=2D poses, Training Data=MotionVid subset2025.03 | 538.949 | 0.156 | 0.27 | 0.366 | 62.338 | 52.55 | 44.135 |