Text-to-video generation on TV-Align (test)
33.7Counting AlignmentVTok
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| VTokParameters=13B2026.02 | 33.7 | 48.3 | 55 | 42.9 | 47.7 | 32.5 | 47.1 | 43.9 | |
| WAN2.2Parameters=14B2026.02 | 32.6 | 46.1 | 51.8 | 38.3 | 46 | 29.5 | 43.2 | 41.1 | |
| WAN2.1Parameters=14B2026.02 | 32.4 | 45.9 | 51.4 | 38.1 | 45.9 | 29.4 | 42.9 | 40.9 | |
| Video-LaViTParameters=13B, Tokenizer=Video-LaViT, Base Model=HunyuanVideo framework2026.02 | 32.4 | 47.3 | 53.1 | 39.8 | 46.9 | 30.2 | 44.6 | 42.1 | |
| OmniTokenizerParameters=13B, Tokenizer=OmniTokenizer, Base Model=HunyuanVideo framework2026.02 | 31.8 | 46.8 | 52.5 | 38.6 | 46.4 | 29.4 | 44 | 41.4 | |
| HunyuanVideoParameters=13B, Role=Direct baseline2026.02 | 31 | 46 | 51.7 | 37.3 | 45.9 | 28.5 | 43.4 | 40.5 | |
| CogVideoX1.5Parameters=5B2026.02 | 29.8 | 43.9 | 49.3 | 36 | 44 | 27.5 | 41 | 38.8 | |
| MochiParameters=10B2026.02 | 29.4 | 43.2 | 48 | 35.2 | 43.6 | 27.1 | 40.5 | 38.1 | |
| OpenSora-2.0Parameters=11B2026.02 | 28.9 | 42.7 | 47 | 34.9 | 43.1 | 26.8 | 40.1 | 37.6 | |
| OpenSora-1.3Parameters=1B2026.02 | 27.8 | 41 | 45.1 | 33.5 | 42.3 | 25.6 | 38.9 | 36.3 |