Video Recognition on Kinetics-400
93.6Top-1 AccOmniVec-2
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| OmniVec-2Multi-modal alignment=true2024.08 | 93.6 | — | — | — | — | |
| InternVideo2Resolution=224x224, Param.=6B, Multi-modal alignment=true2024.08 | 92.1 | — | — | — | — | |
| InternVideoResolution=224x224, Param.=1.3B, Multi-modal alignment=true2024.08 | 91.1 | — | — | — | — | |
| OmniVecMulti-modal alignment=true2024.08 | 91.1 | — | — | — | — | |
| MTV-HPretrain=WTS, Frames=32, Views=4x3, FLOPs (G)=37052023.04 | 89.1 | 98.2 | — | — | — | |
| ILA-ViT-L/14@336pxPretrain=CLIP-400M, Frames=16, Views=4x3, FLOPs (G)=31302023.04 | 88.7 | 97.8 | — | — | — | |
| ILA-ViT-L/14Pretrain=CLIP-400M, Frames=8, Views=4x3, FLOPs (G)=6732023.04 | 88 | 98.1 | — | — | — | |
| Hiera-HResolution=224x224, Param.=673M, Multi-modal alignment=false2024.08 | 87.8 | — | — | — | — | |
| EVL-ViT-L/14@336pxPretrain=CLIP-400M, Frames=32, Views=1x3, FLOPs (G)=60682023.04 | 87.7 | — | — | — | — | |
| X-CLIP-L/14 (@336px)Pretrain=CLIP-400M, Frames=16, Views=4x3, FLOPs (G)=30862023.04 | 87.7 | 97.4 | — | — | — | |
| AIM-ViT-L/14Pretrain=CLIP-400M, Frames=16, Views=1x3, FLOPs (G)=18682023.04 | 87.3 | 97.6 | — | — | — | |
| Hiera-LResolution=224x224, Param.=214M, Multi-modal alignment=false2024.08 | 87.3 | — | — | — | — | |
| CoVeRPretrain=JFT-3B, Views=1x32023.04 | 87.2 | — | — | — | — | |
| MVD-HResolution=224x224, Param.=633M, Multi-modal alignment=false2024.08 | 87.2 | — | — | — | — | |
| GenRecResolution=256x256, Param.=2.1B2024.08 | 87.2 | — | — | — | — | |
| EVL-ViT-L/14Pretrain=CLIP-400M, Frames=16, Views=1x3, FLOPs (G)=13502023.04 | 87 | — | — | — | — | |
| ST-Adapter-ViT-L/14Pretrain=CLIP-400M, Frames=16, Views=1x3, FLOPs (G)=13752023.04 | 86.9 | 97.6 | — | — | — | |
| VideoMAE-HResolution=224x224, Param.=633M, Multi-modal alignment=false2024.08 | 86.6 | — | — | — | — | |
| Baseline IIResolution=256x256, Param.=1.9B, Evaluation Protocol=fully fine-tuning2024.08 | 86.6 | — | — | — | — | |
| MaskFeat-LResolution=312x312, Param.=218M, Multi-modal alignment=false2024.08 | 86.4 | — | — | — | — | |
| MViTv2-L (@312px)Pretrain=IN-21K, Frames=40, Views=5x3, FLOPs (G)=28282023.04 | 86.1 | 97 | — | — | — | |
| ILA-ViT-B/16Pretrain=CLIP-400M, Frames=16, Views=4x3, FLOPs (G)=2952023.04 | 85.7 | 97.2 | — | — | — | |
| OmniMAEArch.=ViT-H, Pretrain Data=IN1K + SSv22022.06 | 85.4 | — | — | — | — | |
| TokenLearner-L/10Pretrain=JFT-300M, Views=4x3, FLOPs (G)=40762023.04 | 85.4 | 96.3 | — | — | — | |
| OmniMAE-HResolution=224x224, Param.=650M, Multi-modal alignment=false2024.08 | 85.4 | — | — | — | — | |
| VideoMAE-LResolution=224x224, Param.=305M, Multi-modal alignment=false2024.08 | 85.2 | — | — | — | — | |
| MAE-VideoArch.=ViT-H, Pretrain Data=K4002022.06 | 85.1 | — | — | — | — | |
| Swin-L (@384px)Pretrain=IN-21K, Frames=32, Views=10x5, FLOPs (G)=21072023.04 | 84.9 | 96.7 | — | — | — | |
| ViViT-H/16x2Pretrain=JFT-300M, Frames=32, Views=4x3, FLOPs (G)=83162023.04 | 84.8 | 95.8 | — | — | — | |
| Ours ViT-Lshot=All2022.07 | 84.7 | — | — | — | — | |
| VideoMAE-16fArch.=ViT-L, Pretrain Data=K4002022.06 | 84.7 | — | — | — | — | |
| X-CLIP-B/16Pretrain=CLIP-400M, Frames=16, Views=4x3, FLOPs (G)=2872023.04 | 84.7 | 96.8 | — | — | — | |
| MaskedFeatArch.=MViT-v2-L, Pretrain Data=K4002022.06 | 84.3 | — | — | — | — | |
| OmniMAEArch.=ViT-L, Pretrain Data=IN1K + SSv22022.06 | 84 | — | — | — | — | |
| ILA-ViT-B/16Pretrain=CLIP-400M, Frames=8, Views=4x3, FLOPs (G)=1492023.04 | 84 | 96.6 | — | — | — | |
| ActionCLIP-B/16Pretrain=CLIP-400M, Frames=32, Views=10x3, FLOPs (G)=5632023.04 | 83.8 | 96.2 | — | — | — | |
| EVL-ViT-B/16Pretrain=CLIP-400M, Frames=16, Views=1x3, FLOPs (G)=2962023.04 | 83.6 | — | — | — | — | |
| Uniformer-BPretrain=IN-1K, Frames=32, Views=4x3, FLOPs (G)=2592023.04 | 83 | 95.4 | — | — | — | |
| ILA-ViT-B/32Pretrain=CLIP-400M, Frames=16, Views=4x3, FLOPs (G)=752023.04 | 82.4 | 95.8 | — | — | — | |
| Baseline IResolution=256x256, Param.=2.1B, Evaluation Protocol=attentive-probing2024.08 | 82 | — | — | — | — | |
| ATAPretrain=IN-21K, Frames=32, Views=4x3, FLOPs (G)=7932023.04 | 81.9 | 95.5 | — | — | — | |
| ILA-ViT-B/32Pretrain=CLIP-400M, Frames=8, Views=4x3, FLOPs (G)=402023.04 | 81.3 | 95 | — | — | — | |
| MViTv1-BPretrain=Random initialization, Frames=64, Views=3x3, FLOPs (G)=4552023.04 | 81.2 | 95.1 | — | — | — | |
| BEVTArch.=Swin-B, Pretrain Data=IN1K + K4002022.06 | 81.1 | — | — | — | — | |
| Mformer-HRPretrain=IN-21K, Frames=16, Views=10x3, FLOPs (G)=9592023.04 | 81.1 | 95.2 | — | — | — | |
| OmniMAEArch.=ViT-B, Pretrain Data=IN1K + K4002022.06 | 80.8 | — | — | — | — | |
| TimeSformer-LPretrain=IN-21K, Frames=96, Views=1x3, FLOPs (G)=23802023.04 | 80.7 | 94.7 | — | — | — | |
| OmniMAEArch.=ViT-B, Pretrain Data=IN1K + SSv22022.06 | 80.6 | — | — | — | — | |
| Ours ViT-Lshot=22022.07 | 78.2 | — | — | — | — | |
| VIMPACArch.=ViT-L/2+, Pretrain Data=HowTo100M2022.06 | 77.4 | — | — | — | — | |
| A6Pretrain=CLIP-400M, Frames=162023.04 | 76.9 | 93.5 | — | — | — | |
| Ours ViT-Lshot=12022.07 | 75.8 | — | — | — | — | |
| Ours ViT-Lshot=02022.07 | 61 | — | — | — | — | |
| VideoPromptshot=52022.07 | 58.5 | — | — | — | — | |
| A5Mode=Adapting, GFLOPs=2842024.11 | — | — | 69.9 | 38.4 | 49.6 | |
| ActionCLIPMode=Adapting, GFLOPs=2822024.11 | — | — | 61.5 | 47.2 | 53.4 | |
| ActionCLIPEvaluation Protocol=Base-to-novel2026.06 | — | — | 61 | 46.2 | 52.6 | |
| AIMEvaluation Protocol=Base-to-novel2026.06 | — | — | 74.6 | 62.5 | 68 | |
| CLIPEvaluation Protocol=Base-to-novel2026.06 | — | — | 62.3 | 53.4 | 57.5 | |
| FROSTEREvaluation Protocol=Base-to-novel2026.06 | — | — | 77.8 | 64.3 | 70.4 | |
| Open-MeDeEvaluation Protocol=Base-to-novel2026.06 | — | — | 77.2 | 63.8 | 69.9 | |
| Open-VCLIPEvaluation Protocol=Base-to-novel2026.06 | — | — | 76.5 | 62.6 | 68.9 | |
| OSTMode=Tuning2024.11 | — | — | 75.4 | 59.6 | 66.6 | |
| ST-AdapterEvaluation Protocol=Base-to-novel2026.06 | — | — | 73.6 | 62 | 67.3 | |
| TACOEvaluation Protocol=Base-to-novel2026.06 | — | — | 78.2 | 63.8 | 70.3 | |
| Vanilla CLIPMode=Zero-shot, GFLOPs=2812024.11 | — | — | 55.1 | 55.2 | 55.1 | |
| Vanilla CLIPMode=Tuning, GFLOPs=2812024.11 | — | — | 76.4 | 63 | 69.1 | |
| ViCLIPMode=Tuning, GFLOPs=1612024.11 | — | — | 78.5 | 65.3 | 71.3 | |
| ViFi-CLIPMode=Tuning, GFLOPs=2812024.11 | — | — | 76.8 | 61.3 | 68.2 | |
| ViFi-CLIPEvaluation Protocol=Base-to-novel2026.06 | — | — | 76.4 | 61.1 | 67.9 | |
| VPTEvaluation Protocol=Base-to-novel2026.06 | — | — | 69.7 | 37.6 | 48.8 | |
| X-CLIPEvaluation Protocol=Base-to-novel2026.06 | — | — | 74.1 | 56.4 | 64 | |
| XCLIPMode=Adapting, GFLOPs=1452024.11 | — | — | 74.7 | 56.7 | 64.5 | |
| Zero-ViCLIPMode=Efficient transfer, GFLOPs=161.742024.11 | — | — | 68.7 | 63.4 | 65.9 | |
| Zero-ViCLIP + AdaptFormerMode=Efficient transfer, GFLOPs=179.802024.11 | — | — | 77.7 | 65.6 | 71.1 | |
| Zero-ViCLIP + LORAMode=Efficient transfer, GFLOPs=179.802024.11 | — | — | 77.6 | 65.3 | 70.9 | |
| Zero-ViCLIP + MSTAMode=Efficient transfer, GFLOPs=179.842024.11 | — | — | 78.2 | 66.2 | 71.7 | |
| Zero-ViCLIP + MSTA + LccMode=Efficient transfer, GFLOPs=179.842024.11 | — | — | 78.5 | 66.5 | 72 |