Video Action Recognition on Kinetics-400
90Top-1 AccVideoMAE V2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VideoMAE V2Backbone=ViT-g, Input Size=64 x 266^2, intermediate fine-tuning=true2023.05 | 90 | 98 | |
| EVAprotocol=fine-tuning2022.11 | 89.7 | — | |
| EVAPre-training Data=K-722 (merged K-400, K-600, K-700)2022.11 | 89.7 | — | |
| EVABackbone=ViT-g, Input Size=16 x 224^2, intermediate fine-tuning=true2023.05 | 89.7 | — | |
| InternVideo2Params (M)=1020, FLOPs (G×T×S)=2500×4×32026.05 | 89.4 | — | |
| CoCaEvaluation Protocol=finetuned2022.05 | 88.9 | — | |
| CoCaEvaluation Protocol=finetuned2022.11 | 88.9 | — | |
| EVAPre-training Data=Image-only pre-training2022.11 | 88.4 | — | |
| ONE-PEACEBackbone=ViT-g, Input Size=32 x 256^2, frozen=true2023.05 | 88.1 | 97.8 | |
| CoCaEvaluation Protocol=frozen2022.05 | 88 | — | |
| CoCaEvaluation Protocol=frozen2022.11 | 88 | — | |
| CoCaBackbone=ViT-g, Input Size=16 x 576^2, frozen=true2023.05 | 88 | — | |
| ViT-22BBackbone=ViT-22B, Input Size=128 x 224^2, frozen=true2023.05 | 88 | — | |
| ONE-PEACEBackbone=ViT-g, Input Size=16 x 256^2, frozen=true2023.05 | 88 | 97.8 | |
| Text4Visprotocol=fine-tuning2022.11 | 87.8 | — | |
| X-CLIP2022.11 | 87.7 | — | |
| AIM ViT-L/14Pretrain=CLIP, GFLOPS=11208, Param (M)=341, Tunable Param (M)=38, Views=32×3×12023.02 | 87.5 | 97.7 | |
| VideoMAE2022.11 | 87.4 | — | |
| VideoMAEBackbone=ViT-H, Input Size=32 x 320^22023.05 | 87.4 | 97.6 | |
| VideoMAE V2Backbone=ViT-H, Input Size=32 x 320^22023.05 | 87.4 | 97.6 | |
| EVL ViT-L/14Pretrain=CLIP, GFLOPS=8088, Param (M)=368, Tunable Param (M)=59, Views=32×3×12023.02 | 87.3 | — | |
| AIM ViT-L/14Pretrain=CLIP, GFLOPS=5604, Param (M)=341, Tunable Param (M)=38, Views=16×3×12023.02 | 87.3 | 97.6 | |
| CoVeR2022.05 | 87.2 | — | |
| CoVeR2022.11 | 87.2 | — | |
| X-CLIP-L/14Pretrain=CLIP, GFLOPS=7890, Param (M)=420, Tunable Param (M)=420, Views=8×4×32023.02 | 87.1 | 97.6 | |
| mPLUG-2Setting=Fine-tuning2023.02 | 87.1 | 97.7 | |
| MaskFeat2022.05 | 87 | — | |
| MaskFeat2022.11 | 87 | — | |
| MaskFeatBackbone=MViTv2-L, Input Size=40 x 352^22023.05 | 87 | 97.4 | |
| Florence2022.05 | 86.8 | — | |
| SwinV2-Gprotocol=fine-tuning2022.11 | 86.8 | — | |
| MAE2022.11 | 86.8 | — | |
| SwinV2-G2022.11 | 86.8 | — | |
| Florence2022.11 | 86.8 | — | |
| AIM ViT-L/14Pretrain=CLIP, GFLOPS=2802, Param (M)=341, Tunable Param (M)=38, Views=8×3×12023.02 | 86.8 | 97.2 | |
| SwinV2Backbone=Swin-G, Input Size=N/A x 384^22023.05 | 86.8 | — | |
| MAE-STBackbone=ViT-H, Input Size=16 x 224^22023.05 | 86.8 | 97.2 | |
| FlorencePretraining Data=FLD-900M, Views=4 x 3, Params=647M2021.11 | 86.5 | 97.3 | |
| FlorencePretraining Data=FLD-900M, Views=4 x 3, Params=647M2021.11 | 86.5 | 97.3 | |
| Florenceprotocol=fine-tuning2022.11 | 86.5 | — | |
| FlorenceSetting=Fine-tuning2023.02 | 86.5 | 97.3 | |
| FloranceBackbone=Co-Swin-H, Input Size=N/A x 384^22023.05 | 86.5 | 97.3 | |
| CoVeRSetting=Fine-tuning2023.02 | 86.3 | 97.2 | |
| MViTv2-Lpre-train=IN-21K, Resolution=312x312, Input sampling=40x3, FLOPs=2828G, views=3x5, Param=217.6M2021.12 | 86.1 | 97 | |
| MViTv2-L (312↑)Pretrain=IN-21K, GFLOPS=42420, Param (M)=218, Tunable Param (M)=218, Views=32×3×52023.02 | 86.1 | 97 | |
| UMT-BArch=Trans., Isotropic=true, Extra Data=CLIP-400M, Input Size=8x224^2, Parameters (M)=87, FLOPs (G)=180x3x5, Training Paradigm=Self-supervised, Epochs=800e2024.03 | 85.7 | 97 | |
| UMT-B800eParams (M)=87, FLOPs (G×T×S)=180×4×32026.05 | 85.7 | — | |
| TokenLearner 16at18+L/10Pretraining Data=JFT-300M, Views=4 x 3, Params=460M2021.11 | 85.4 | 96.3 | |
| TokenLearner 16at18+L/10Pretraining Data=JFT-300M, Views=4 x 3, Params=460M2021.11 | 85.4 | 96.3 | |
| TokenLearner-L/10Pretrain=JFT, GFLOPS=48912, Param (M)=450, Tunable Param (M)=450, Views=64×4×32023.02 | 85.4 | 96.3 | |
| TokenLearnerSetting=Fine-tuning2023.02 | 85.4 | 96.3 | |
| DUAL-PathEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 85.4 | — | |
| OV-Encoder (Codec)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 85.4 | — | |
| OV-Encoder (Frame)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 85.1 | — | |
| V-JEPA-2Params (M)=355, FLOPs (G×T×S)=935×8×32026.05 | 85.1 | — | |
| VideoMamba-MArch=SSM, Isotropic=true, Extra Data=CLIP-400M, Input Size=64x384^2, Parameters (M)=74, FLOPs (G)=2368x3x4, Training Paradigm=Self-supervised, Epochs=800e2024.03 | 85 | 96.9 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=10 x 5, Params=200M2021.11 | 84.9 | 96.7 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=10 x 5, Params=200M2021.11 | 84.9 | 96.7 | |
| Swin-Lpre-train=IN-21K, Resolution=384x384, FLOPs=2107G, views=5x10, Param=200.0M2021.12 | 84.9 | 96.7 | |
| VideoSwin-LSetting=Fine-tuning2023.02 | 84.9 | 96.7 | |
| ViViTBackbone=ViT-H, Input Size=32 x 224^22023.05 | 84.9 | 95.8 | |
| ViViT-H/16x2Pretraining Data=JFT-300M, Views=4 x 3, Params=648M2021.11 | 84.8 | 95.8 | |
| ViViT-H/16x2Pretraining Data=JFT-300M, Views=4 x 3, Params=648M2021.11 | 84.8 | 95.8 | |
| ViViT2022.05 | 84.8 | — | |
| ViViT-HSetting=Fine-tuning2023.02 | 84.8 | 95.8 | |
| AIM ViT-B/16Pretrain=CLIP, GFLOPS=2428, Param (M)=97, Tunable Param (M)=11, Views=32×3×12023.02 | 84.7 | 96.7 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=4 x 3, Params=200M2021.11 | 84.6 | 96.5 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=4 x 3, Params=200M2021.11 | 84.6 | 96.5 | |
| LookWhen (70% sparse)Params (M)=106, FLOPs (G×T×S)=108×4×3, sparsity=70%2026.05 | 84.6 | — | |
| AIM ViT-B/16Pretrain=CLIP, GFLOPS=1214, Param (M)=97, Tunable Param (M)=11, Views=16×3×12023.02 | 84.5 | 96.6 | |
| OV-Encoder (Codec)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 84.4 | — | |
| MTV-LPretrain=JFT, GFLOPS=18050, Param (M)=876, Tunable Param (M)=876, Views=32×4×32023.02 | 84.3 | 96.3 | |
| OV-Encoder (Frame)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 84.3 | — | |
| ILAEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 84 | — | |
| MetaCLIP2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 84 | — | |
| VideoMambaProParams (M)=72, FLOPs (G×T×S)=392×4×32026.05 | 84 | — | |
| AIM ViT-B/16Pretrain=CLIP, GFLOPS=606, Param (M)=97, Tunable Param (M)=11, Views=8×3×12023.02 | 83.9 | 96.3 | |
| VideoMamba-MArch=SSM, Isotropic=true, Extra Data=CLIP-400M, Input Size=32x224^2, Parameters (M)=74, FLOPs (G)=403x3x4, Training Paradigm=Self-supervised, Epochs=800e2024.03 | 83.9 | 96.2 | |
| ViFi-CLIPEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 83.9 | — | |
| AIMEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 83.9 | — | |
| DINOv3Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 83.9 | — | |
| ActionCLIPPretrain=CLIP, GFLOPS=16890, Param (M)=142, Tunable Param (M)=142, Views=32×10×32023.02 | 83.8 | 97.1 | |
| X-CLIPEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 83.8 | — | |
| mPLUG-2BaseSetting=Fine-tuning2023.02 | 83.6 | 96 | |
| VideoMamba-MArch=SSM, Isotropic=true, Extra Data=CLIP-400M, Input Size=16x224^2, Parameters (M)=74, FLOPs (G)=202x3x4, Training Paradigm=Self-supervised, Epochs=800e2024.03 | 83.4 | 95.9 | |
| VideoMamba-M800eParams (M)=74, FLOPs (G×T×S)=202×4×32026.05 | 83.4 | — | |
| VideoMamba-MArch=SSM, Isotropic=true, Extra Data=IN-1K, Input Size=64x384^2, Parameters (M)=74, FLOPs (G)=2368x3x4, Training Paradigm=Supervised2024.03 | 83.3 | 96.1 | |
| VideoSwin-LPretrain=IN-21K, GFLOPS=7248, Param (M)=197, Tunable Param (M)=197, Views=32×4×32023.02 | 83.1 | 95.9 | |
| SMILEEvaluation Protocol=Finetuning, Intermediate Dataset=K400 [35]2025.04 | 83.1 | — | |
| UniFormer-BPretrain=IN-1K, GFLOPS=3108, Param (M)=50, Tunable Param (M)=50, Views=32×4×32023.02 | 83 | 95.4 | |
| UniFormer-BArch=CNN+Trans., Isotropic=false, Extra Data=IN-1K, Input Size=32x224^2, Parameters (M)=50, FLOPs (G)=259x3x4, Training Paradigm=Supervised2024.03 | 83 | 95.4 | |
| MViTv2-B, 32×3pre-train=scratch, FLOPs=225G, views=1x5, Param=51.2M2021.12 | 82.9 | 95.7 | |
| DINOv3Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 82.9 | — | |
| Swin-BArch=Trans., Isotropic=false, Extra Data=IN-21K, Input Size=32x224^2, Parameters (M)=88, FLOPs (G)=282x3x4, Training Paradigm=Supervised2024.03 | 82.7 | 95.5 | |
| VideoMamba-SArch=SSM, Isotropic=true, Extra Data=IN-1K, Input Size=64x384^2, Parameters (M)=26, FLOPs (G)=395x3x4, Training Paradigm=Supervised2024.03 | 82.7 | 95.6 | |
| SigLIP2Backbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 82.7 | — | |
| LookWhen (90% sparse)Params (M)=106, FLOPs (G×T×S)=40×4×3, sparsity=90%2026.05 | 82.6 | — | |
| VideoMamba-MArch=SSM, Isotropic=true, Extra Data=IN-1K, Input Size=32x224^2, Parameters (M)=74, FLOPs (G)=403x3x4, Training Paradigm=Supervised2024.03 | 82.4 | 95.7 | |
| ViCLIPEvaluation Protocol=Finetuning, Intermediate Dataset=Intervid-10M [84]2025.04 | 82.4 | — | |
| MetaCLIP2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 82.4 | — |