Text-to-Video generation on VBench 17 frames, 512x512
45.9URSSVAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 45.9 | 30.7 | 828 | |
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=Wan 1.3B2025.12 | 45.5 | 29.5 | 823 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 42.8 | 30.6 | 1,019 | |
| IV-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 41.8 | 29.8 | 997 | |
| Wan 2.1 VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 41.6 | 29.8 | 978 | |
| BaselineCPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 40.9 | 29.1 | 770 | |
| CogvideoX VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 39 | 29.1 | 971 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=Wan 1.3B2025.12 | 37.7 | 27.3 | 1,124 | |
| Hunyuan VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 36.9 | 28.1 | 1,166 | |
| WF-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 36.3 | 27.9 | 1,352 | |
| StepVideo VAECPR=(16 × 16 × 8), Chn=64, Backbone=MMDiT 1.3B2025.12 | 35.6 | 28 | 1,190 |