Text-to-Video on VBench (Efficiency and Perceptual Metrics)
23.96ThroughputVideoMLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| VideoMLAModel Category=Chunk-wise autoregressive models, #Params=1.3B, Resolution=832×480, Hardware=B200, Batch Size=12026.05 | 23.96 | 3.38 | 0.3278 | 0.9686 | 9.74 | |
| LongSANAModel Category=Chunk-wise autoregressive models, #Params=2B, Resolution=832×480, Hardware=B200, Batch Size=12026.05 | 19.35 | 4.48 | 0.2978 | 0.9887 | 7.54 | |
| Self-ForcingModel Category=Chunk-wise autoregressive models, #Params=1.3B, Resolution=832×480, Hardware=B200, Batch Size=12026.05 | 18.06 | 4.19 | 0.3036 | 0.9689 | 9.86 | |
| NOVAModel Category=Frame-wise autoregressive models, #Params=0.6B, Resolution=768×480, Hardware=B200, Batch Size=12026.05 | 2.26 | 14.63 | 0.2764 | 0.9673 | 2.95 | |
| Pyramid FlowModel Category=Frame-wise autoregressive models, #Params=2B, Resolution=640×384, Hardware=B200, Batch Size=12026.05 | 1.39 | 87.32 | 0.2888 | 0.9795 | 8.02 |