Text-to-Video Generation on VBench short-video (test)
89.2Semantic ConsistencyCVG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CVGBackbone=Wan2.2-14B, Guidance=CVG2026.05 | 89.2 | 85.6 | 86.3 | |
| TTOMBackbone=Wan2.2-14B, Guidance=TTOM2026.05 | 84.6 | 85.4 | 85 | |
| Wan2.2-14BBackbone=Wan2.2-14B2026.05 | 82.6 | 84.6 | 83.6 | |
| CVGBackbone=Wan2.2-5B, Guidance=CVG2026.05 | 80.9 | 81.2 | 81.1 | |
| CVGBackbone=CogVideoX-5B, Guidance=CVG2026.05 | 78.6 | 79.3 | 78.9 | |
| TTOMBackbone=Wan2.2-5B, Guidance=TTOM2026.05 | 77.6 | 80.8 | 79.2 | |
| Wan2.2-5BBackbone=Wan2.2-5B2026.05 | 75.8 | 80 | 77.9 | |
| TTOMBackbone=CogVideoX-5B, Guidance=TTOM2026.05 | 75.1 | 79.1 | 77.1 | |
| CogVideoX-5BBackbone=CogVideoX-5B2026.05 | 73.2 | 78.4 | 75.8 |