Action Recognition on Kinetics-400 1.0 (val)
90.6Top-1 AccuracyUMT-L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UMT-LBackbone=ViT-L, Extra data=K710, Input Size=16×224^2, GFLOPS=1434×3×4, Param=304, Epochs=200e, intermediate fine-tuning=true2023.03 | 90.6 | 98.7 | |
| UMT-LBackbone=ViT-L, Extra data=K710, Input Size=8×224^2, GFLOPS=596×3×4, Param=304, Epochs=200e, intermediate fine-tuning=true2023.03 | 90.3 | 98.7 | |
| UniFormerV2-LBackbone=ViT-L, Extra data=CLIP-400M+K710, Input Size=64×336^2, GFLOPS=12550×3×2, Param=354, intermediate fine-tuning=true2023.03 | 90 | 98.4 | |
| MTV-HBackbone=ViT-H+B+S+T, Extra data=IN-21K+WTS-60M, Input Size=32×280^2, GFLOPS=6130×3×4, Param=1000+2023.03 | 89.9 | 98.3 | |
| UMT-LBackbone=ViT-L, Extra data=K710, Input Size=8×224^2, GFLOPS=596×3×4, Param=304, Epochs=200e2023.03 | 89.1 | 98.2 | |
| CoCaBackbone=ViT-g, Extra data=JFT-3B+ALIGN-1.8B, Input Size=16×576^2, Param=1000+2023.03 | 88.9 | — | |
| UMT-LBackbone=ViT-L, Input Size=8×224^2, GFLOPS=596×3×4, Param=304, Epochs=400e2023.03 | 88.9 | 98.3 | |
| UMT-BBackbone=ViT-B, Extra data=K710, Input Size=8×224^2, GFLOPS=180×3×4, Param=87, Epochs=200e, intermediate fine-tuning=true2023.03 | 87.4 | 97.5 | |
| MVD-HBackbone=ViT-H, Extra data=IN-1K, Input Size=16×224^2, GFLOPS=1192×3×5, Param=633, Epochs=800e2023.03 | 87.2 | 97.4 | |
| CoVeRBackbone=ViT-L, Extra data=JFT-3B+SSV2+MiT+IN, Input Size=16×448^2, GFLOPS=5860×3×1, Param=4312023.03 | 87.1 | — | |
| ST-MAE-LBackbone=ViT-L, Extra data=K600, Input Size=16×224^2, GFLOPS=598×3×7, Param=304, Epochs=1600e, intermediate fine-tuning=true2023.03 | 86.5 | 97.2 | |
| VideoMAE-LBackbone=ViT-L, Input Size=16×320^2, GFLOPS=3958×3×5, Param=304, Epochs=1600e2023.03 | 86.1 | 97.3 | |
| UMT-BBackbone=ViT-B, Input Size=8×224^2, GFLOPS=180×3×4, Param=87, Epochs=800e2023.03 | 85.7 | 97 | |
| UMT-BBackbone=ViT-B, Extra data=K710, Input Size=8×224^2, GFLOPS=180×3×4, Param=87, Epochs=200e2023.03 | 85.7 | 96.9 | |
| VideoMAE-LBackbone=ViT-L, Input Size=16×224^2, GFLOPS=597×3×5, Param=304, Epochs=1600e2023.03 | 85.2 | 96.8 | |
| ViViT-HBackbone=ViT-H, Extra data=JFT-300M, Input Size=32×320^2, GFLOPS=3981×3×4, Param=6542023.03 | 84.9 | 95.8 | |
| ST-MAE-LBackbone=ViT-L, Extra data=K600, Input Size=16×224^2, GFLOPS=598×3×7, Param=304, Epochs=1600e2023.03 | 84.9 | 96.2 | |
| MaskFeatBackbone=MViTv2-L, Input Size=16×224^2, GFLOPS=377×1×10, Param=218, Epochs=1600e2023.03 | 84.3 | 96.3 | |
| VideoSwin-LBackbone=Swin-L, Extra data=IN-21K, Input Size=32×224^2, GFLOPS=604×3×4, Param=1972023.03 | 83.1 | 95.9 | |
| UniFormer-BBackbone=UniFormer-B, Extra data=IN-1K, Input Size=32×224^2, GFLOPS=259×3×4, Param=502023.03 | 83 | 95.4 | |
| irCSNBackbone=irCSN-152, Pre-train=IG65M2022.01 | 82.6 | 95.3 | |
| MUFI+fine-tuningBackbone=ResNet-101, Pre-train=Multi-Faceted2022.01 | 82.3 | 95.3 | |
| MoViNet-A6GFLOPS=386, Parameters=31.4M2021.03 | 81.5 | 95.3 | |
| VideoMAE-BBackbone=ViT-B, Input Size=16×224^2, GFLOPS=180×3×5, Param=87, Epochs=1600e2023.03 | 81.5 | 95.1 | |
| ViT-L-ViViTpre-train=ImageNet-21K, FLOPs=3992G, views=3x4, Param=310.8M2021.04 | 81.3 | 94.7 | |
| ViViT-L/16x2GFLOPS=3990, Parameters=88.9M2021.03 | 81.3 | 94.7 | |
| R(2+1)DBackbone=ResNet-152, Pre-train=IG65M2022.01 | 81.3 | 95.1 | |
| ST-MAE-BBackbone=ViT-B, Input Size=16×224^2, GFLOPS=180×3×7, Param=87, Epochs=1600e2023.03 | 81.3 | 94.9 | |
| MViT-B, 64x3pre-train=None, FLOPs=455G, views=3x3, Param=36.6M2021.04 | 81.2 | 95.1 | |
| MViTv2-BBackbone=MViTv2-B, Input Size=32×224^2, GFLOPS=255×1×5, Param=372023.03 | 81.2 | 95.1 | |
| MUFI+fine-tuningBackbone=ResNet-50, Pre-train=Multi-Faceted2022.01 | 81.1 | 95.1 | |
| BEVTBackbone=Swin-B, Extra data=IN-1K, Input Size=32×224^2, GFLOPS=282×3×4, Param=88, Epochs=800e2023.03 | 81.1 | — | |
| MoViNet-A5GFLOPS=281, Parameters=15.7M2021.03 | 80.9 | 94.9 | |
| ViT-B-TimeSformerpre-train=ImageNet-21K, FLOPs=2380G, views=3x1, Param=121.4M2021.04 | 80.7 | 94.7 | |
| TimeSformer-LGFLOPS=7140, Parameters=120M2021.03 | 80.7 | 94.7 | |
| TimeSformer-LBackbone=ViT-B, Extra data=IN-21K, Input Size=96×224^2, GFLOPS=2380×3×1, Param=1212023.03 | 80.7 | 94.7 | |
| MoViNet-A4GFLOPS=105, Parameters=5.9M2021.03 | 80.5 | 94.5 | |
| X3D-XXLGFLOPS=5800, Parameters=20.3M2021.03 | 80.4 | 94.6 | |
| MViT-B, 32x3pre-train=None, FLOPs=170G, views=1x5, Param=36.6M2021.04 | 80.2 | 94.4 | |
| SlowFastsampling=16x8, backbone=ResNet-101, NL=true, GFLOPS x views=234 x 302018.12 | 79.8 | 93.9 | |
| SlowFast 16x8+NLpre-train=None, FLOPs=234G, views=3x10, Param=59.9M2021.04 | 79.8 | 93.9 | |
| SlowFastBackbone=ResNet-101+NL2022.01 | 79.8 | 93.9 | |
| MUFI+linearBackbone=ResNet-101, Pre-train=Multi-Faceted2022.01 | 79.8 | 93.2 | |
| SlowFast101Backbone=R101+NL, Input Size=80×224^2, GFLOPS=234×3×10, Param=602023.03 | 79.8 | 93.9 | |
| R(2+1)DBackbone=ResNet-34, Pre-train=IG65M2022.01 | 79.6 | 93.9 | |
| LGD-3DBackbone=ResNet-101, Pre-train=ImageNet2022.01 | 79.4 | 94.4 | |
| ViT-B (baseline)pre-train=ImageNet-21K, FLOPs=180G, views=1x5, Param=87.2M2021.04 | 79.3 | 93.9 | |
| X3D-XLpre-train=None, FLOPs=48.4G, views=3x10, Param=11.0M2021.04 | 79.1 | 93.9 | |
| X3D-XLGFLOPS=1452, Parameters=11.0M2021.03 | 79.1 | 93.9 | |
| irCSNBackbone=irCSN-152, Pre-train=Sports1M2022.01 | 79 | 93.5 | |
| MUFI+linearBackbone=ResNet-50, Pre-train=Multi-Faceted2022.01 | 79 | 92.3 | |
| SlowFastsampling=16x8, backbone=ResNet-101, GFLOPS x views=213 x 302018.12 | 78.9 | 93.5 | |
| SlowFastBackbone=ResNet-1012022.01 | 78.9 | 93.5 | |
| SwinBackbone=Swin-T, Pretrain=ImageNet, Frame=32, #Param.=28.2M, GFLOPS x Views=88×3×42023.03 | 78.8 | 93.6 | |
| SlowFast 8x8+NLpre-train=None, FLOPs=116G, views=3x10, Param=59.9M2021.04 | 78.7 | 93.5 | |
| ViT-B-VTNpre-train=ImageNet-21K, FLOPs=4218G, views=1x1, Param=114.0M2021.04 | 78.6 | 93.7 | |
| MViT-B, 16x4pre-train=None, FLOPs=70.5G, views=1x5, Param=36.6M2021.04 | 78.4 | 93.5 | |
| MoViNet-A3GFLOPS=56.9, Parameters=5.3M2021.03 | 78.2 | 93.8 | |
| TimeSformer-SBackbone=ViT-B, Pretrain=ImageNet, Frame=8, #Param.=121.4M, GFLOPS x Views=590×3×102023.03 | 78 | 93.7 | |
| SlowFastsampling=8x8, backbone=ResNet-101, GFLOPS x views=106 x 302018.12 | 77.9 | 93.2 | |
| ip-CSN-152pre-train=None, FLOPs=109G, views=3x10, Param=32.8M2021.04 | 77.8 | 92.8 | |
| Nonlocalbackbone=ResNet-101, flow=false, pretrain=ImageNet, GFLOPS x views=359 x 302018.12 | 77.7 | 93.3 | |
| NL I3DBackbone=ResNet-101, Pre-train=ImageNet2022.01 | 77.7 | 93.3 | |
| E3DBackbone=E3D-L, Pretrain=No pretrain, Frame=16, #Param.=5.8M, GFLOPS x Views=18.3×3×102023.03 | 77.6 | 92.9 | |
| X3D-LGFLOPS=744, Parameters=6.1M2021.03 | 77.5 | 92.9 | |
| TDNBackbone=ResNet50, Pretrain=ImageNet, Frame=16+64, GFLOPS x Views=72×3×102023.03 | 77.5 | 93.2 | |
| X3DBackbone=X3D-L, Pretrain=No pretrain, Frame=16, #Param.=3.8M, GFLOPS x Views=24.8×3×102023.03 | 77.5 | 92.9 | |
| S3D-Gflow=true, pretrain=ImageNet, GFLOPS x views=143 x N/A2018.12 | 77.2 | 93 | |
| SlowFastsampling=8x8, backbone=ResNet-50, GFLOPS x views=65.7 x 302018.12 | 77 | 92.6 | |
| SlowFastBackbone=ResNet-502022.01 | 77 | 92.6 | |
| SlowFastBackbone=ResNet50, Pretrain=ImageNet, Frame=8+32, #Param.=34.4M, GFLOPS x Views=65.7×3×102023.03 | 77 | 92.6 | |
| TANetBackbone=ResNet50, Pretrain=ImageNet, Frame=16, #Param.=26M, GFLOPS x Views=86×3×102023.03 | 76.9 | 92.9 | |
| irCSNBackbone=irCSN-152, Pre-train=none2022.01 | 76.8 | 92.5 | |
| Nonlocalbackbone=ResNet-50, flow=false, pretrain=ImageNet, GFLOPS x views=282 x 302018.12 | 76.5 | 92.6 | |
| E3DBackbone=E3D-M, Pretrain=No pretrain, Frame=16, #Param.=3.4M, GFLOPS x Views=4.7×3×102023.03 | 76.4 | 92.5 | |
| TEABackbone=ResNet50, Pretrain=ImageNet, Frame=16, GFLOPS x Views=70×3×102023.03 | 76.1 | 92.5 | |
| X3D-Mpre-train=None, FLOPs=6.2G, views=3x10, Param=3.8M2021.04 | 76 | 92.3 | |
| MViT-Spre-train=None, FLOPs=32.9G, views=1x5, Param=26.1M2021.04 | 76 | 92.1 | |
| X3D-MGFLOPS=186, Parameters=3.8M2021.03 | 76 | 92.3 | |
| X3DBackbone=X3D-M, Pretrain=No pretrain, Frame=16, #Param.=3.8M, GFLOPS x Views=6.2×3×102023.03 | 76 | 92.3 | |
| Two-Stream I3Dflow=true, pretrain=ImageNet, GFLOPS x views=216 x N/A2018.12 | 75.7 | 92 | |
| Two-Stream I3DBackbone=InceptionV1, Pretrain=ImageNet, Frame=64, #Param.=25M, GFLOPS x Views=216×N/A2023.03 | 75.7 | 92 | |
| SlowFastsampling=4x16, backbone=ResNet-50, GFLOPS x views=36.1 x 302018.12 | 75.6 | 92.1 | |
| ViT-B-VTNpre-train=ImageNet-1K, FLOPs=4218G, views=1x1, Param=114.0M2021.04 | 75.6 | 92.4 | |
| MoViNet-A2GFLOPS=10.3, Parameters=4.8M2021.03 | 75 | 92.3 | |
| MoViNetBackbone=MoViNet-A2, Pretrain=No pretrain, Frame=50, #Param.=4.6M, GFLOPS x Views=10.3×1×12023.03 | 75 | 92.3 | |
| SlowOnlyBackbone=ResNet50, Pretrain=ImageNet, Frame=8, GFLOPS x Views=42×3×102023.03 | 74.8 | 91.6 | |
| S3D-GBackbone=BN-Inception, Pre-train=ImageNet2022.01 | 74.7 | 93.4 | |
| TSMBackbone=ResNet50, Pretrain=ImageNet, Frame=16, #Param.=24.3M, GFLOPS x Views=65×3×102023.03 | 74.7 | 91.4 | |
| S3D-GBackbone=InceptionV1, Pretrain=ImageNet, Frame=64, GFLOPS x Views=71.4×3×102023.03 | 74.7 | 93.4 | |
| R(2+1)DBackbone=ResNet-34, Pre-train=Sports1M2022.01 | 74.3 | 91.4 | |
| R(2+1)Dflow=false, GFLOPS x views=304 x 1152018.12 | 73.9 | 90.9 | |
| R(2+1)DBackbone=ResNet50, Pretrain=ImageNet, Frame=16, #Param.=63.6M, GFLOPS x Views=67×3×102023.03 | 73.7 | 91.6 | |
| X3D-SGFLOPS=76.1, Parameters=3.8M2021.03 | 73.5 | — | |
| MoViNet-A1GFLOPS=6.02, Parameters=4.6M2021.03 | 72.7 | 91.2 | |
| TSNBackbone=ResNet50, Pretrain=ImageNet, Frame=25, #Param.=24.3M, GFLOPS x Views=80×1×102023.03 | 72.5 | 90.2 | |
| I3Dflow=false, pretrain=ImageNet, GFLOPS x views=108 x N/A2018.12 | 72.1 | 90.3 | |
| I3DBackbone=BN-Inception, Pre-train=ImageNet2022.01 | 72.1 | 90.3 | |
| I3DBackbone=InceptionV1, Pretrain=ImageNet, Frame=64, #Param.=12M, GFLOPS x Views=108×N/A2023.03 | 72.1 | 90.3 | |
| R(2+1)Dflow=false, GFLOPS x views=152 x 1152018.12 | 72 | 90 |