Action Recognition on Moments in Time
53.1Top-1 AccuracyOmniVec2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OmniVec22025.07 | 53.1 | — | |
| InternVideo2_s1-6BTraining Data=IV-2M, Setting=16 x 224, Inference Mode=End-to-end finetuning2024.03 | 51.2 | — | |
| InternVideo2_s1-6BTraining Data=IV-2M, Setting=8 x 224, Inference Mode=End-to-end finetuning2024.03 | 51 | — | |
| InternVideo2_s1-1BTraining Data=IV-1.1M, Setting=16 x 224, Inference Mode=End-to-end finetuning2024.03 | 50.9 | — | |
| InternVideo2_s1-1BTraining Data=IV-1.1M, Setting=8 x 224, Inference Mode=End-to-end finetuning2024.03 | 50.8 | — | |
| OmniVec2025.07 | 49.8 | — | |
| CoCafine-tuned=true2025.07 | 49 | — | |
| CoCaEvaluation Protocol=finetuned2022.05 | 49 | — | |
| CoCa-gTraining Data=I-3B, Setting=16 x 576, Inference Mode=End-to-end finetuning2024.03 | 49 | — | |
| Uniformer v22025.07 | 47.8 | — | |
| UniFormerV2-LTraining Data=IV-401M, Setting=64 x 336, Inference Mode=End-to-end finetuning2024.03 | 47.8 | — | |
| CoCafine-tuned=false2025.07 | 47.4 | — | |
| CoCaEvaluation Protocol=frozen2022.05 | 47.4 | — | |
| COVERPretrain=JFT-3B, Finetune=K400+SSv2+MiT+ImNet, Views=1x32021.12 | 46.1 | — | |
| CoVeR2022.05 | 46.1 | — | |
| CoVeRTraining Data=IV-3B, Setting=16 x 448, Inference Mode=End-to-end finetuning2024.03 | 46.1 | — | |
| COVERPretrain=JFT-3B, Finetune=K600+SSv2+MiT+ImNet, Views=1x32021.12 | 45.9 | — | |
| COVERPretrain=JFT-3B, Finetune=K700+SSv2+MiT+ImNet, Views=1x32021.12 | 45.9 | — | |
| COVERPretrain=JFT-300M, Finetune=K400+SSv2+MiT+ImNet, Views=1x32021.12 | 45 | — | |
| COVERPretrain=JFT-300M, Finetune=K700+SSv2+MiT+ImNet, Views=1x32021.12 | 44.8 | — | |
| COVERPretrain=JFT-300M, Finetune=K600+SSv2+MiT+ImNet, Views=1x32021.12 | 44.5 | — | |
| MultiTrainTraining Data=K700, SSv2, MiT, ActivityNet, gFLOPS=614, Input Resolution=312p2022.09 | 43.5 | 73 | |
| MultiTrain (312p)Pre-/Training Data=(e),(f),(g),(h), gFLOPs=6142022.09 | 43.1 | 71.9 | |
| MultiTrainTraining Data=K700, SSv2, MiT, ActivityNet, gFLOPS=2242022.09 | 42.2 | 72.3 | |
| MTV-B (320p)Pre-/Training Data=+(a), gFLOPs=11162022.09 | 41.7 | 69.7 | |
| MultiTrainPre-/Training Data=(e),(f),(g),(h), gFLOPs=2242022.09 | 41.7 | 71 | |
| MTV-BTraining Data=ImageNet-21K, gFLOPS=1116, Input Resolution=320p2022.09 | 41.7 | 69.7 | |
| COVERPretrain=ImageNet21k, Finetune=K600+SSv2+MiT+ImNet, Views=1×3, Base Architecture=TimeSFormer2021.12 | 41.5 | — | |
| COVERPretrain=ImageNet21k, Finetune=K700+SSv2+MiT+ImNet, Views=1×3, Base Architecture=TimeSFormer2021.12 | 41.5 | — | |
| COVERTraining Data=ImageNet-21K, K700, SSv2, MiT, gFLOPS=23802022.09 | 41.5 | — | |
| COVERPretrain=ImageNet21k, Finetune=K400+SSv2+MiT+ImNet, Views=1×3, Base Architecture=TimeSFormer2021.12 | 41.3 | — | |
| COVERPre-/Training Data=(a),(e),(f),(g), gFLOPs=23802022.09 | 41.3 | — | |
| VATT2025.07 | 41.1 | — | |
| VATTPretrain=AudioSet+Videos, Finetune=MiT, Views=4x32021.12 | 41.1 | — | |
| VATT2022.05 | 41.1 | — | |
| VATTPre-/Training Data=(c),(d), Downstream, gFLOPs=24832022.09 | 41.1 | 67.7 | |
| VATTTraining Data=AudioSet, HowTo100M, Downstream, gFLOPS=24832022.09 | 41.1 | 67.7 | |
| MoViNet2022.05 | 40.2 | — | |
| MoViNetPre-/Training Data=Scratch, gFLOPs=3862022.09 | 40.2 | — | |
| Ours-baselinePre-/Training Data=Scratch, gFLOPs=2242022.09 | 38.6 | 67.5 | |
| PolyViTPre-/Training Data=(b),(e),(f) + [Audio] + [Image], gFLOPs=39922022.09 | 38.6 | 65.5 | |
| Ours-baselineTraining Data=Scratch, gFLOPS=2242022.09 | 38.6 | 67.5 | |
| ViViTPretrain=ImageNet21k, Finetune=MiT, Views=4×32021.12 | 38.5 | — | |
| ViViTPre-/Training Data=+(a), gFLOPs=39922022.09 | 38.5 | 64.1 | |
| ViViT2022.05 | 38 | — | |
| bLVNet-TAMBackbone=bLResNet-50, Pretrain=Moments, Frames=16×2, Modality=RGB2019.12 | 31.4 | 59.3 | |
| Ensemble2019.12 | 31.2 | 57.7 | |
| bLVNet-TAMBackbone=bLResNet-50, Pretrain=ImageNet, Frames=8×2, Modality=RGB2019.12 | 31.2 | 58.3 | |
| I3DBackbone=ResNet-50, Frames=16, Modality=RGB2019.12 | 29.5 | 56.1 | |
| TRNBackbone=Inception, Pretrain=ImageNet, Frames=16, Modality=RGB2019.12 | 28.3 | 53.9 | |
| TSNBackbone=BNInception, Frames=16+16, Modality=RGB+Flow2019.12 | 25.3 | 50.1 | |
| TSNBackbone=BNInception, Pretrain=ImageNet, Frames=16, Modality=RGB2019.12 | 24.1 | 49.1 | |
| SoundNetModality=Audio2019.12 | 7.6 | 18 |