Action Classification on Kinetics-400 v1 (val)
89.9Top-1 AccMTV-H
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MTV-Hpre-train=supervised, extra data=WTS-60M, architecture=MTV-H, input size=32 x 280^2, FLOPS=6130 x 3 x 4, param.=n/a2022.05 | 89.9 | 98.3 | |
| CoVeRpre-train=supervised, extra data=JFT-3B+SSv2+MiT+IN, architecture=CoVeR, input size=16 x 448^2, FLOPS=n/a x 3 x 1, param.=n/a2022.05 | 87.2 | — | |
| MaskFeatpre-train=MaskFeat, extra data=K600, architecture=MViTv2-L, input size=40 x 352^2, FLOPS=3790 x 3 x 4, param.=2182022.05 | 87 | 97.4 | |
| MAEpre-train=MAE, extra data=K600, architecture=ViT-H, input size=16 x 224^2, FLOPS=1193 x 3 x 7, param.=6322022.05 | 86.8 | 97.2 | |
| SwinV2-Gpre-train=SimMIM [80] + sup., extra data=IN21K+70M, architecture=SwinV2-G, input size=8 x 384^2, FLOPS=n/a x 5 x 4, param.=30002022.05 | 86.8 | — | |
| MaskFeatpre-train=MaskFeat, architecture=MViTv2-L, input size=40 x 352^2, FLOPS=3790 x 3 x 4, param.=2182022.05 | 86.7 | 97.3 | |
| MAEpre-train=MAE, extra data=K600, architecture=ViT-L, input size=16 x 224^2, FLOPS=598 x 3 x 7, param.=3042022.05 | 86.5 | 97.2 | |
| Florencepre-train=supervised + text, extra data=FLD-900M, architecture=Florence, input size=n/a x 384^2, FLOPS=n/a x 3 x 4, param.=6472022.05 | 86.5 | 97.3 | |
| MAEpre-train=MAE, architecture=ViT-H, input size=32 x 312^2, FLOPS=6382 x 3 x 7, param.=6322022.05 | 86 | 97 | |
| MAEpre-train=MAE, architecture=ViT-L, input size=40 x 312^2, FLOPS=4757 x 3 x 7, param.=3042022.05 | 85.8 | 96.9 | |
| MAEpre-train=MAE, architecture=ViT-H, input size=16 x 224^2, FLOPS=1193 x 3 x 7, param.=6322022.05 | 85.1 | 96.6 | |
| Swin-Lpre-train=supervised, extra data=IN21K, architecture=Swin-L, input size=32 x 384^2, FLOPS=2107 x 5 x 10, param.=2002022.05 | 84.9 | 96.7 | |
| ViViT-Hpre-train=supervised, extra data=JFT-300M, architecture=ViViT-H, input size=32 x 320^2, FLOPS=3981 x 3 x 4, param.=6542022.05 | 84.9 | 95.8 | |
| MAEpre-train=MAE, architecture=ViT-L, input size=16 x 224^2, FLOPS=598 x 3 x 7, param.=3042022.05 | 84.8 | 96.2 | |
| MaskFeatpre-train=MaskFeat, architecture=MViTv2-L, input size=16 x 224^2, FLOPS=377 x 1 x 10, param.=2182022.05 | 84.3 | 96.3 | |
| ViViT-Lpre-train=supervised, extra data=JFT-300M, architecture=ViViT-L, input size=32 x 320^2, FLOPS=3980 x 3 x 1, param.=3082022.05 | 83.5 | 94.3 | |
| Swin-Lpre-train=supervised, extra data=IN21K, architecture=Swin-L, input size=32 x 224^2, FLOPS=604 x 3 x 4, param.=1972022.05 | 83.1 | 95.9 | |
| MViTv2-Bpre-train=scratch, architecture=MViTv2-B, input size=32 x 224^2, FLOPS=255 x 1 x 5, param.=512022.05 | 82.9 | 95.7 | |
| Swin-Bpre-train=supervised, extra data=IN21K, architecture=Swin-B, input size=32 x 224^2, FLOPS=282 x 3 x 4, param.=882022.05 | 82.7 | 95.5 | |
| MoViNetpre-train=scratch, architecture=MoViNet, input size=120 x 320^2, FLOPS=386 x 1 x 1, param.=312022.05 | 81.5 | 95.3 | |
| MAEpre-train=MAE, architecture=ViT-B, input size=16 x 224^2, FLOPS=180 x 3 x 7, param.=872022.05 | 81.3 | 94.9 | |
| MVIT-Bpre-train=scratch, architecture=MVIT-B, input size=64 x 224^2, FLOPS=455 x 3 x 3, param.=372022.05 | 81.2 | 95.1 | |
| BEVTpre-train=BEVT, extra data=IN1K+DALLE, architecture=Swin-B, input size=32 x 224^2, FLOPS=282 x 3 x 4, param.=882022.05 | 81.1 | — | |
| SlowFastpre-train=scratch, architecture=SlowFast, input size=64 x 224^2, FLOPS=234 x 3 x 10, param.=602022.05 | 79.8 | 93.9 | |
| X3D-XLpre-train=scratch, architecture=X3D-XL, input size=16 x 312^2, FLOPS=48 x 3 x 10, param.=112022.05 | 79.1 | 93.9 |