Text-to-multi-shot video generation on T2MSV Text-to-multi-shot
0.5874Character Coherence (Inter-shot)OneStory
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OneStory2025.12 | 0.5874 | 0.5752 | 0.5813 | 0.2389 | 0.9364 | 0.941 | 0.9387 | 0.5731 | 0.4698 | |
| StoryDiff. + Wan2.1Framework=StoryDiff., Video Model=Wan2.12025.12 | 0.5633 | 0.5681 | 0.5657 | 0.2217 | 0.9286 | 0.9357 | 0.9322 | 0.5703 | 0.4231 | |
| Mask2DiT2025.12 | 0.5472 | 0.5419 | 0.5446 | 0.2253 | 0.9024 | 0.915 | 0.9087 | 0.5235 | 0.4247 | |
| StoryDiff. + LTX-VideoFramework=StoryDiff., Video Model=LTX-Video2025.12 | 0.5468 | 0.5397 | 0.5433 | 0.2165 | 0.9036 | 0.9125 | 0.9081 | 0.5418 | 0.3694 | |
| Flux + Wan2.1Backbone=Flux, Video Model=Wan2.12025.12 | 0.5454 | 0.5598 | 0.5526 | 0.1915 | 0.9225 | 0.9353 | 0.9289 | 0.5572 | 0.4492 | |
| Flux + LTX-VideoBackbone=Flux, Video Model=LTX-Video2025.12 | 0.5316 | 0.5456 | 0.5386 | 0.1837 | 0.8841 | 0.8957 | 0.8899 | 0.507 | 0.3746 |