Text-to-Video generation on MovieGenBench 17 frames, 512x512
29.2URWF-VAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| WF-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 29.2 | 22.2 | 894 | |
| StepVideo VAECPR=(16 × 16 × 8), Chn=64, Backbone=MMDiT 1.3B2025.12 | 29.4 | 21.6 | 866 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=Wan 1.3B2025.12 | 30.6 | 23.2 | 736 | |
| CogvideoX VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 31.2 | 23.4 | 675 | |
| Hunyuan VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 31.9 | 23.5 | 892 | |
| BaselineCPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 32.9 | 23.3 | 581 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 33.4 | 23.7 | 733 | |
| Wan 2.1 VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 33.6 | 23.7 | 791 | |
| IV-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 34.1 | 23.4 | 776 | |
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=Wan 1.3B2025.12 | 34.5 | 24.9 | 691 | |
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 35.7 | 24.3 | 605 |