Class-Conditional Video Generation on UCF101
57gFVDLARP-L-Long
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LARP-L-LongTokenizer Parameters=173M, Generator Parameters=632M, Number of Tokens=1024, Training Strategy=More epochs2024.10 | 57 | — | |
| MAGVIT-v2-MLMGenerator Parameters=307M, Number of Tokens=12802024.10 | 58 | — | |
| HPDMGenerator Parameters=725M2024.10 | 66 | — | |
| MAGVIT-MLMTokenizer Parameters=158M, Generator Parameters=306M, Number of Tokens=10242024.10 | 76 | — | |
| VideoAR-XLNumber of Parameters=2.0B, Sampling Steps=30, Inference Time (s)=1.122026.01 | 88.6 | — | |
| VideoAR-LNumber of Parameters=926M, Sampling Steps=30, Inference Time (s)=0.862026.01 | 90.3 | — | |
| PAR-4xNumber of Parameters=792M, Sampling Steps=323, Inference Time (s)=11.272026.01 | 99.5 | — | |
| LARP-L-LongTokenizer Parameters=173M, Generator Parameters=343M, Number of Tokens=1024, Training Strategy=More epochs2024.10 | 102 | — | |
| LARP-LTokenizer Parameters=173M, Generator Parameters=343M, Number of Tokens=10242024.10 | 107 | — | |
| MAGVIT-v2-ARGenerator Parameters=840M, Number of Tokens=12802024.10 | 109 | — | |
| MAGVIT-v2-ARNumber of Parameters=840M, Sampling Steps=12802026.01 | 109 | — | |
| VideoFusionGenerator Parameters=2B2024.10 | 173 | — | |
| OmniTokenizerTokenizer Parameters=82.2M, Generator Parameters=650M, Number of Tokens=12802024.10 | 191 | — | |
| OmniTokenizerNumber of Parameters=650M, Sampling Steps=5120, Inference Time (s)=336.72026.01 | 191 | — | |
| MAGVIT-ARTokenizer Parameters=158M, Generator Parameters=306M, Number of Tokens=10242024.10 | 265 | — | |
| TATSTokenizer Parameters=32M, Generator Parameters=321M, Number of Tokens=10242024.10 | 332 | — | |
| TATSNumber of Parameters=312M2026.01 | 332 | — | |
| CogVideoGenerator Parameters=9.4B, Number of Tokens=20652024.10 | 626 | — | |
| CogVideoNumber of Parameters=9.4B2026.01 | 626 | — | |
| ACDITType=Frame-AR, Params=677 M, Double Train Cost=true, Resolution=256x2562025.03 | — | 111 | |
| CogVideoType=Token-AR, Params=9.4 B, Double Train Cost=false, Resolution=256x2562025.03 | — | 626 | |
| FAR-LType=Frame-AR, Params=457 M, Double Train Cost=false, Resolution=128x1282025.03 | — | 99 | |
| FAR-LType=Frame-AR, Params=457 M, Double Train Cost=false, Resolution=256x2562025.03 | — | 113 | |
| FAR-XLType=Frame-AR, Params=674 M, Double Train Cost=false, Resolution=256x2562025.03 | — | 108 | |
| MAGVITV2-ARType=Token-AR, Params=840 M, Double Train Cost=false, Resolution=128x1282025.03 | — | 109 | |
| MAGVITV2-MLMType=Non-AR, Params=307 M, Double Train Cost=false, Resolution=128x1282025.03 | — | 58 | |
| OmniTokenizerType=Token-AR, Params=650 M, Double Train Cost=false, Resolution=256x2562025.03 | — | 191 | |
| TATSType=Token-AR, Params=331 M, Double Train Cost=false, Resolution=128x1282025.03 | — | 332 |