Compositional Video Generation on DCR-Bench (full evaluation set)
0.3131CLIPScoreDCR
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DCRBackbone=Mochi2026.05 | 0.3131 | 0.2558 | 0.8075 | 4.13 | 0.31 | |
| Default Completion RepulsionBase Model=Mochi2026.05 | 0.3131 | 0.2558 | 0.8075 | 4.13 | 0.31 | |
| DCR w/o ScheduleBackbone=Mochi2026.05 | 0.3115 | 0.274 | 0.7819 | 3.9675 | 0.355 | |
| DCR w/o ScheduleBase Model=Mochi, Ablation=w/o Schedule2026.05 | 0.3115 | 0.274 | 0.7819 | 3.9675 | 0.355 | |
| DCR w/o Attractor PromptBackbone=Mochi2026.05 | 0.3088 | 0.2709 | 0.7794 | 3.9275 | 0.34 | |
| DCR w/o RepulsionBackbone=Mochi2026.05 | 0.3088 | 0.2732 | 0.7729 | 3.95 | 0.3475 | |
| DCR w/o Attractor PromptBase Model=Mochi, Ablation=w/o Attractor Prompt2026.05 | 0.3088 | 0.2709 | 0.7794 | 3.9275 | 0.34 | |
| DCR w/o RepulsionBase Model=Mochi, Ablation=w/o Repulsion2026.05 | 0.3088 | 0.2732 | 0.7729 | 3.95 | 0.3475 | |
| HunyuanVideoGuidance strategy=Standard CFG2026.05 | 0.3067 | 0.2725 | 0.7819 | 3.975 | 0.375 | |
| HunyuanVideoGuidance=Standard CFG2026.05 | 0.3067 | 0.2725 | 0.7819 | 3.975 | 0.375 | |
| MochiGuidance strategy=Standard CFG2026.05 | 0.304 | 0.2718 | 0.7807 | 3.8375 | 0.4725 | |
| MochiGuidance=Standard CFG2026.05 | 0.304 | 0.2718 | 0.7807 | 3.8375 | 0.4725 | |
| CogVideoXGuidance strategy=Standard CFG2026.05 | 0.2858 | 0.2644 | 0.729 | 3.1925 | 0.5175 | |
| CogVideoXGuidance=Standard CFG2026.05 | 0.2858 | 0.2644 | 0.729 | 3.1925 | 0.5175 | |
| Negative PromptBackbone=Mochi, Guidance strategy=Negative prompt within standard CFG2026.05 | 0.2735 | 0.261 | 0.7065 | 3.0375 | 0.4375 | |
| Negative PromptBase Model=Mochi, Guidance=Negative prompt within standard CFG2026.05 | 0.2735 | 0.261 | 0.7065 | 3.0375 | 0.4375 |