Class-to-video generation on UCF-101
46gFVDW.A.L.T-L
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| W.A.L.T-LGenerator #Params=313M2026.03 | 46 | — | — | |
| EVATokTokenizer #Params=145M, Generator #Params=633M2026.03 | 48 | — | 756 | |
| LARP-L-LongTokenizer #Params=173M, Generator #Params=632M2026.03 | 57 | — | 1,024 | |
| MAGVIT-v2-MLMGenerator #Params=307M2026.03 | 58 | — | 1,280 | |
| EVATokTokenizer #Params=145M, Generator #Params=327M2026.03 | 62 | — | 756 | |
| HPDMGenerator #Params=725M2026.03 | 66 | — | — | |
| AdapTokTokenizer #Params=195M, Generator #Params=633M2026.03 | 67 | — | 1,024 | |
| MAGVIT-MLMTokenizer #Params=158M, Generator #Params=306M2026.03 | 76 | — | 1,024 | |
| LARP-L-LongTokenizer #Params=173M, Generator #Params=343M2026.03 | 102 | — | 1,024 | |
| MAGVIT-v2-ARGenerator #Params=840M2026.03 | 109 | — | 1,280 | |
| VideoFusionGenerator #Params=2B2026.03 | 173 | — | — | |
| OmniTokenizerTokenizer #Params=82.2M, Generator #Params=650M2026.03 | 191 | — | 1,280 | |
| MAGVIT-ARTokenizer #Params=158M, Generator #Params=306M2026.03 | 265 | — | 1,024 | |
| TATSTokenizer #Params=32M, Generator #Params=321M2026.03 | 332 | — | 1,024 | |
| CogVideoGenerator #Params=9.4B2026.03 | 626 | — | — | |
| ACDITArchitecture=DiT, VAE=2D2025.05 | — | 90 | — | |
| CogVideoResolution=160 x 160, Architecture=Dual-channel Transformer, VAE=2D2025.05 | — | 626 | — | |
| FARResolution=128 x 128, Architecture=DiT, VAE=2D2025.05 | — | 57 | — | |
| LARPResolution=128 x 128, Architecture=Vanilla Transformer, VAE=3D2025.05 | — | 57 | — | |
| LatteResolution=256 x 256, Architecture=DiT, VAE=2D2025.05 | — | 478 | — | |
| MAGVITv2Architecture=Vanilla Transformer, VAE=3D2025.05 | — | 58 | — | |
| MAGVITV2-ARArchitecture=Vanilla Transformer, VAE=3D2025.05 | — | 109 | — | |
| Make-A-VideoResolution=256 x 256, Architecture=U-Net, VAE=2D2025.05 | — | 81 | — | |
| OmniTokenizerResolution=256 x 256, Architecture=Vanilla Transformer, VAE=3D2025.05 | — | 191 | — | |
| TATSResolution=128 x 128, Architecture=Time-Sensitive Transformer2025.05 | — | 332 | — | |
| Video-GPTResolution=240 x 320, Architecture=Vanilla Transformer, VAE=2D, training_mode=from scratch2025.05 | — | 489 | — | |
| Video-GPTResolution=240 x 320, Architecture=Vanilla Transformer, VAE=2D, training_mode=finetune2025.05 | — | 53 | — | |
| VideoFusionResolution=128 x 128, Architecture=U-Net2025.05 | — | 173 | — |