Text-to-Video Generation on VBench (Total, Quality, Semantic Scores, and Speedup)
1.8SpeedupEViT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| EViTToken Reduction Rate=40%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.8 | 78.44 | 80.35 | 70.78 | |
| TAPEToken Reduction Rate=40%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.8 | 81.58 | 83.76 | 72.85 | |
| ToMeToken Reduction Rate=40%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.7 | 77.93 | 80.03 | 69.54 | |
| STA-ViTToken Reduction Rate=40%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.7 | 77.9 | 79.63 | 70.98 | |
| EViTToken Reduction Rate=30%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.5 | 80.34 | 82.28 | 72.6 | |
| ToMeToken Reduction Rate=30%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.5 | 79.3 | 81.54 | 70.34 | |
| TAPEToken Reduction Rate=30%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.5 | 82.52 | 84.48 | 74.67 | |
| STA-ViTToken Reduction Rate=30%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.4 | 79.16 | 81.05 | 71.62 | |
| EViTToken Reduction Rate=20%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.3 | 81.88 | 84.04 | 73.22 | |
| ToMeToken Reduction Rate=20%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.3 | 80.93 | 83.22 | 71.76 | |
| TAPEToken Reduction Rate=20%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.3 | 83.27 | 85.2 | 75.53 | |
| STA-ViTToken Reduction Rate=20%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1.2 | 81.6 | 83.61 | 73.54 | |
| BaselineToken Reduction Rate=0%, Base Model=Wan2.1-T2V-1.3B2026.05 | 1 | 83.31 | 85.23 | 75.65 |