Action Recognition on Kinetics 700
84Top-1 AccuracyInternVideo-T
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| InternVideo-T#Params=1.3B2022.12 | 84 | — | — | — | |
| TubeViT-LBackbone scale=L2022.12 | 83.8 | 96.6 | — | — | |
| InternVideo-D#Params=1.0B2022.12 | 83.8 | — | — | — | |
| UMT-LInput Size=16x224^2, FLOPs (T)=17.2, Param (M)=304, Pre-training=K710, Fine-tuning=Intermediate2023.03 | 83.6 | 96.7 | — | — | |
| MTV-HPre-training dataset=WTS, Input resolution=280p, Backbone scale=H2022.12 | 83.4 | 96.2 | — | — | |
| MTV-H#Params=1B+2022.12 | 83.4 | — | — | — | |
| MTV-HInput Size=32x320^2, FLOPs (T)=73.6, Param (M)=1000+, extra_data=web-scale2023.03 | 83.4 | 96.2 | — | — | |
| UMT-LInput Size=8x224^2, FLOPs (T)=7.2, Param (M)=304, Pre-training=K710, Fine-tuning=Intermediate2023.03 | 83.2 | 96.5 | — | — | |
| CoCaPre-training dataset=Align 1.8B2022.12 | 82.7 | — | — | — | |
| CoCa#Params=1B+2022.12 | 82.7 | — | — | — | |
| CoCaInput Size=16x576^2, Param (M)=1000+, extra_data=web-scale2023.03 | 82.7 | — | — | — | |
| UniFormerV2-LInput Size=64x336^2, FLOPs (T)=75.3, Param (M)=354, extra_data=web-scale2023.03 | 82.7 | 96.2 | — | — | |
| MTV-HInput Size=32x224^2, FLOPs (T)=44.5, Param (M)=1000+, extra_data=web-scale2023.03 | 82.2 | 95.7 | — | — | |
| UniFormerV2-LInput Size=32x224^2, FLOPs (T)=16.0, Param (M)=354, extra_data=web-scale2023.03 | 82.1 | 96.1 | — | — | |
| MaskFeat-L#Params=218M2022.12 | 80.4 | — | — | — | |
| MaskFeat (40 × 312↑)Pretrain=K700, Tunable Param=218M2023.02 | 80.4 | — | — | — | |
| AIM ViT-L/14Pretrain=CLIP, Tunable Param=38M2023.02 | 80.4 | — | — | — | |
| COVERPretrain=JFT-3B, Finetune=K700+SSv2+MiT+ImNet, Views=1x32021.12 | 79.8 | — | — | — | |
| CoVeRPre-training dataset=JFT-3B2022.12 | 79.8 | — | — | — | |
| CoVeRInput Size=16x448^2, FLOPs (T)=17.6, Param (M)=431, extra_data=web-scale2023.03 | 79.8 | — | — | — | |
| MViT-v2Training Data=ImageNet-21K, gFLOPS=28282022.09 | 79.4 | 94.9 | — | — | |
| MViTv2-L (40 × 312↑)Pretrain=IN-21K, Tunable Param=218M2023.02 | 79.4 | — | — | — | |
| MViTv2-LInput Size=40x312^2, FLOPs (T)=33.9, Param (M)=2182023.03 | 79.4 | 94.9 | — | — | |
| COVERPretrain=JFT-300M, Finetune=K700+SSv2+MiT+ImNet, Views=1x32021.12 | 78.5 | — | — | — | |
| UMT-BInput Size=8x224^2, FLOPs (T)=2.2, Param (M)=87, Pre-training=K710, Fine-tuning=Intermediate2023.03 | 78.5 | 94.3 | — | — | |
| AIM ViT-B/16Pretrain=CLIP, Tunable Param=11M2023.02 | 76.9 | — | — | — | |
| MViTv2-BTunable Param=51M2023.02 | 76.6 | — | — | — | |
| MultiTrainTraining Data=K700, SSv2, MiT, ActivityNet, gFLOPS=614, Input Resolution=312p2022.09 | 76.3 | 93.5 | — | — | |
| EfficientNet-L2 (pretrain)GFLOPS=15400, PARAM=480M2021.03 | 76.2 | — | — | — | |
| MultiTrainTraining Data=K700, SSv2, MiT, ActivityNet, gFLOPS=2242022.09 | 75.8 | 93.2 | — | — | |
| MTV-BTraining Data=ImageNet-21K, gFLOPS=1116, Input Resolution=320p2022.09 | 75.2 | 91.7 | — | — | |
| MTV-LPretrain=IN-21K, Tunable Param=876M2023.02 | 75.2 | — | — | — | |
| COVERPretrain=ImageNet21k, Finetune=K700+SSv2+MiT+ImNet, Views=1×3, Base Architecture=TimeSFormer2021.12 | 74.9 | — | — | — | |
| COVERTraining Data=ImageNet-21K, K700, SSv2, MiT, gFLOPS=23802022.09 | 74.9 | — | — | — | |
| Ours-baselineTraining Data=Scratch, gFLOPS=2242022.09 | 74.1 | 91.9 | — | — | |
| VATTTraining Data=AudioSet, HowTo100M, Downstream, gFLOPS=24832022.09 | 72.7 | — | — | — | |
| MoViNet-A6GFLOPS=386, PARAM=31.4M2021.03 | 72.3 | — | — | — | |
| MoViNetPretrain=None, Finetune=K700, Views=1x12021.12 | 72.3 | — | — | — | |
| MoViNetTraining Data=Scratch, gFLOPS=3862022.09 | 72.3 | — | — | — | |
| MoViNet-A6Backbone scale=A62022.12 | 72.3 | — | — | — | |
| MoViNet-A5GFLOPS=281, PARAM=15.7M2021.03 | 71.7 | — | — | — | |
| SlowFast-R152GFLOPS=9500, PARAM=80M2021.03 | 71.6 | — | — | — | |
| SlowFast R101Backbone scale=R1012022.12 | 71 | 89.6 | — | — | |
| SlowFast101Input Size=80x224^2, FLOPs (T)=7.0, Param (M)=602023.03 | 71 | 89.6 | — | — | |
| VidTrPretrain=ImageNet21k, Finetune=K700, Views=1x32021.12 | 70.8 | — | — | — | |
| VidTrTraining Data=ImageNet-21K, gFLOPS=3922022.09 | 70.8 | — | — | — | |
| MoViNet-A4GFLOPS=105, PARAM=4.9M2021.03 | 70.7 | — | — | — | |
| SlowFast-R101GFLOPS=3200, PARAM=30M2021.03 | 70.2 | — | — | — | |
| VidTR-LBackbone scale=L2022.12 | 70.2 | — | — | — | |
| VidTR-LPretrain=IN-21K, Tunable Param=91M2023.02 | 70.2 | — | — | — | |
| IMP-MoE-LPPT=350M, TPU-DAYS=1.5k, Zero-shot=true2023.05 | 68.3 | — | — | — | |
| MoViNet-A3GFLOPS=56.9, PARAM=5.3M2021.03 | 68 | — | — | — | |
| MoViNet-A2GFLOPS=10.3, PARAM=4.8M2021.03 | 66.7 | — | — | — | |
| InternVideo2_clip-1B#F=8, Protocol=Zero-shot2024.03 | 64.9 | — | 75.2 | — | |
| InternVideo2_clip-6B#F=8, Protocol=Zero-shot2024.03 | 64.2 | — | 75.2 | — | |
| MoViNet-A1GFLOPS=6.02, PARAM=4.6M2021.03 | 63.5 | — | — | — | |
| VideoCoCaPPT=2B, TPU-DAYS=10.5k, Zero-shot=true2023.05 | 62.5 | — | — | — | |
| InternVL-6B#F=8, Protocol=Zero-shot2024.03 | 60.6 | — | 71.5 | — | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 60.3 | — | — | — | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 60.1 | — | — | — | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 59.8 | — | — | — | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 59.6 | — | — | — | |
| MoViNet-A0GFLOPS=2.71, PARAM=3.1M2021.03 | 58.5 | — | — | — | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 57.8 | — | — | — | |
| ViCLIP-L#F=8, Protocol=Zero-shot2024.03 | 54.3 | — | 66.4 | — | |
| IMP-MoE-BPPT=90M, TPU-DAYS=150, Zero-shot=true2023.05 | 52.1 | — | — | — | |
| IMP-BPPT=86M, TPU-DAYS=120, Zero-shot=true2023.05 | 49.9 | — | — | — | |
| SlowFast + PASInference Strategy=SlowFast stacked with PAS2025.11 | 49.8 | — | — | 46 | |
| TS-LLaVA + PASInference Strategy=TS-LLaVA stacked with PAS2025.11 | 49.1 | — | — | 45.9 | |
| PASInference Strategy=Phase Aggregated Smoothing (Ours)2025.11 | 48.2 | — | — | 45.1 | |
| CLIP#F=8, Protocol=Zero-shot2024.03 | 46.1 | — | 58.4 | — | |
| SlowFast-LLaVAInference Strategy=SlowFast2025.11 | 45.1 | — | — | 42.3 | |
| Default SettingInference Strategy=Default Setting, Backbone=Qwen2.5-VL-7B-Instruct2025.11 | 44.9 | — | — | 41 | |
| TS-LLaVAInference Strategy=TS-LLaVA2025.11 | 44.7 | — | — | 40.8 | |
| EVA-CLIP-18B#F=16, Protocol=Zero-shot2024.03 | — | — | 72.2 | — | |
| EVA-CLIP-E#F=1, Protocol=Zero-shot2024.03 | — | — | 63.4 | — | |
| EVA-CLIP-L#F=1, Protocol=Zero-shot2024.03 | — | — | 59.1 | — |