Multi-scene video generation on Multi-scene evaluation dataset 1.0 (test)
70.95Visual ConsistencyMask²DiT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Mask²DiTArchitecture=DiT-based, Training Strategy=Multi-scene training2025.03 | 70.95 | 23.94 | 47.45 | 720.01 | |
| StoryDiffusion + CogVideoX-I2VBase Model=StoryDiffusion [42], I2V Model=CogVideoX-I2V [38]2025.03 | 69.06 | 25.59 | 47.32 | 905.69 | |
| TALC2025.03 | 67.47 | 20.25 | 43.86 | 1,516.59 | |
| VideoStudio2025.03 | 61.28 | 22.64 | 41.96 | 1,213.88 | |
| CogVideoX2025.03 | 55.01 | 22.64 | 38.82 | 835.35 |