Text-to-Video generation on Movie 17 frames, 256x256 (val)
39.1URSSVAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 39.1 | 31.6 | 511 | |
| IV-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 37.7 | 30.9 | 541 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 36.7 | 30.8 | 432 | |
| Wan 2.1 VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 36.5 | 30.8 | 517 | |
| BaselineCPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 36.3 | 30.9 | 455 | |
| CogvideoX VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 32.6 | 29.9 | 543 | |
| Hunyuan VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 32.1 | 28.9 | 610 | |
| StepVideo VAECPR=(16 × 16 × 8), Chn=64, Backbone=MMDiT 1.3B2025.12 | 31.8 | 28.8 | 418 | |
| WF-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 30.6 | 27.9 | 514 |