Text-to-Video generation on VBench 17 frames, 256x256
34.7URSSVAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 34.7 | 27.7 | 983 | |
| IV-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 34 | 27.8 | 1,066 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 33.6 | 27.9 | 873 | |
| Wan 2.1 VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 33.3 | 27.2 | 986 | |
| BaselineCPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 32.4 | 27.1 | 909 | |
| CogvideoX VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 30.4 | 26.6 | 1,040 | |
| Hunyuan VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 29.7 | 25.9 | 1,354 | |
| StepVideo VAECPR=(16 × 16 × 8), Chn=64, Backbone=MMDiT 1.3B2025.12 | 29.7 | 25.6 | 1,004 | |
| WF-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 26.5 | 23.7 | 978 |