Text-to-Video Generation on VBench standard (test)
1.8SpeedupEViT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| EViTToken Reduction Rate=40%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.8 | 79.38 | 81.53 | 70.77 | |
| ToMeToken Reduction Rate=40%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.8 | 78.26 | 79.88 | 71.78 | |
| TAPEToken Reduction Rate=40%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.8 | 81.04 | 83.2 | 72.42 | |
| STA-ViTToken Reduction Rate=40%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.7 | 77.46 | 79.44 | 69.53 | |
| EViTToken Reduction Rate=30%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.5 | 81.15 | 82.96 | 73.9 | |
| TAPEToken Reduction Rate=30%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.5 | 82.01 | 83.64 | 75.5 | |
| ToMeToken Reduction Rate=30%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.4 | 80.92 | 82.74 | 73.66 | |
| STA-ViTToken Reduction Rate=30%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.4 | 79.3 | 81.3 | 71.28 | |
| EViTToken Reduction Rate=20%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.3 | 81.82 | 83.62 | 74.64 | |
| TAPEToken Reduction Rate=20%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.3 | 83.16 | 84.9 | 76.2 | |
| ToMeToken Reduction Rate=20%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.2 | 82.18 | 83.92 | 75.22 | |
| STA-ViTToken Reduction Rate=20%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1.2 | 80.87 | 82.77 | 73.29 | |
| BaselineToken Reduction Rate=0%, Backbone=HunyuanVideo (13B), Resolution=720p2026.05 | 1 | 83.24 | 85.09 | 75.82 |