Text-to-Video generation on Movie 17 frames, 512x512 (val)
50.8URSSVAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 50.8 | 34.8 | 403 | |
| SSVAECPR=(16 × 16 × 4), Chn=48, Backbone=Wan 1.3B2025.12 | 48.6 | 33.5 | 466 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 47.9 | 34 | 502 | |
| Wan 2.1 VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 46.6 | 33.9 | 500 | |
| BaselineCPR=(16 × 16 × 4), Chn=48, Backbone=MMDiT 1.3B2025.12 | 46.5 | 33.9 | 504 | |
| IV-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 46.4 | 33.2 | 535 | |
| Wan 2.2 VAECPR=(16 × 16 × 4), Chn=48, Backbone=Wan 1.3B2025.12 | 42.3 | 31.6 | 601 | |
| Hunyuan VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 41.4 | 31.5 | 663 | |
| CogvideoX VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 41.3 | 32.5 | 452 | |
| WF-VAECPR=(8 × 8 × 4), Chn=16, Backbone=MMDiT 1.3B2025.12 | 39.8 | 31.3 | 667 | |
| StepVideo VAECPR=(16 × 16 × 8), Chn=64, Backbone=MMDiT 1.3B2025.12 | 37 | 30.9 | 562 |