Text-guided Video Editing on DavisBench
0.97TCMotionEcho (DiTFlow 4 steps)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MotionEcho (DiTFlow 4 steps)Backbone=CogVideoX-2b-TDM, ITC=50s, Steps=42025.06 | 0.97 | 0.34 | 0.726 | 128.11 | |
| MotionEcho (MOFT 4 steps)Backbone=CogVideoX-2b-TDM, ITC=48s, Steps=42025.06 | 0.969 | 0.342 | 0.528 | 127.52 | |
| MotionEcho (DMT 4 steps)Backbone=CogVideoX-2b-TDM, ITC=47s, Steps=42025.06 | 0.968 | 0.343 | 0.7 | 126.24 | |
| DiTFlowBackbone=CogVideoX-2b, ITC=90s2025.06 | 0.962 | 0.338 | 0.72 | 130.54 | |
| MOFTBackbone=CogVideoX-2b, ITC=84s2025.06 | 0.958 | 0.311 | 0.485 | 134.88 | |
| DMTBackbone=CogVideoX-2b, ITC=82s2025.06 | 0.954 | 0.332 | 0.715 | 126.14 |