Action Recognition on Kinetics-600
98.2Top-1 AccVideo-STAR-7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Video-STAR-7BProtocol=Cross-Dataset2026.03 | 98.2 | — | — | |
| Video-STAR-7BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 98.2 | — | — | |
| InternVideo2Protocol=Fine-Tuned2026.03 | 91.9 | — | — | |
| TubeVit-HPre-training=leveraged ViT-H, Backbone=ViT-H2022.12 | 91.8 | 98.9 | — | |
| TubeVit-LPre-training=ImageNet-1k, Backbone=ViT-L2022.12 | 91.5 | 98.7 | — | |
| InternVideo-T#Params=1.3B2022.12 | 91.3 | — | — | |
| Merlot-Reserve-LPre-training=YT-1B, Backbone=Merlot-Reserve-L2022.12 | 91.1 | 97.1 | — | |
| MerlotReserve-L (+Audio)#Params=644M2022.12 | 91.1 | — | — | |
| InternVideo-D#Params=1.0B2022.12 | 91.1 | — | — | |
| TubeVit-BPre-training=ImageNet-1k, Backbone=ViT-B2022.12 | 90.9 | 97.3 | — | |
| UMT-LInput Size=16x224^2, FLOPs (T)=17.2, Param (M)=304, Pre-training=K710, Fine-tuning=Intermediate2023.03 | 90.5 | 98.8 | — | |
| Video-STAR-3BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 90.5 | — | — | |
| UMT-LInput Size=8x224^2, FLOPs (T)=7.2, Param (M)=304, Pre-training=K710, Fine-tuning=Intermediate2023.03 | 90.4 | 98.7 | — | |
| MTV-HPre-training=WTS 280p, Backbone=MTV-H2022.12 | 90.3 | 98.5 | — | |
| MTV-H#Params=1B+2022.12 | 90.3 | — | — | |
| MTV-HInput Size=32x320^2, FLOPs (T)=73.6, Param (M)=1000+, extra_data=web-scale2023.03 | 90.3 | 98.5 | — | |
| MerlotReserve-L#Params=644M2022.12 | 90.1 | — | — | |
| UniFormerV2-LInput Size=64x336^2, FLOPs (T)=75.3, Param (M)=354, extra_data=web-scale2023.03 | 90.1 | 98.5 | — | |
| MTV-HInput Size=32x224^2, FLOPs (T)=44.5, Param (M)=1000+, extra_data=web-scale2023.03 | 89.6 | 98.3 | — | |
| UniFormerV2-LInput Size=32x224^2, FLOPs (T)=16.0, Param (M)=354, extra_data=web-scale2023.03 | 89.5 | 98.3 | — | |
| CoCaPre-training=ALIGN 1.8B2022.12 | 89.4 | — | — | |
| CoCa#Params=1B+2022.12 | 89.4 | — | — | |
| CoCaInput Size=16x576^2, Param (M)=1000+, extra_data=web-scale2023.03 | 89.4 | — | — | |
| MaskFeat-L#Params=218M2022.12 | 88.3 | — | — | |
| COVERPretrain=JFT-3B, Finetune=K600+SSv2+MiT+ImNet, Views=1x32021.12 | 87.9 | — | — | |
| CoVeRPre-training=JFT-3B2022.12 | 87.9 | — | — | |
| CoVeRInput Size=16x448^2, FLOPs (T)=17.6, Param (M)=431, extra_data=web-scale2023.03 | 87.9 | — | — | |
| FlorencePre-training=FLD-900M2022.12 | 87.8 | 97.8 | — | |
| UMT-BInput Size=8x224^2, FLOPs (T)=2.2, Param (M)=87, Pre-training=K710, Fine-tuning=Intermediate2023.03 | 87.8 | 97.8 | — | |
| MViTv2-LInput Size=40x312^2, FLOPs (T)=33.9, Param (M)=2182023.03 | 87.5 | 97.8 | — | |
| COVERPretrain=JFT-300M, Finetune=K600+SSv2+MiT+ImNet, Views=1x32021.12 | 86.8 | — | — | |
| TokenLearnerPretrain=JFT-300M, Finetune=K600, Views=4x32021.12 | 86.3 | — | — | |
| TokenLearner-L/10Pre-training=JFT, Backbone=TokenLearner-L2022.12 | 86.3 | 97 | — | |
| Video SwinTransPretrain=ImageNet21k, Finetune=K600, Views=10×52021.12 | 86.1 | — | — | |
| ViViTPretrain=JFT-300M, Finetune=K600, Views=4x32021.12 | 85.8 | — | — | |
| ViViT-HPre-training=JFT, Backbone=ViViT-H2022.12 | 85.8 | 96.5 | — | |
| MoViNet-A6Backbone=MoViNet-A62022.12 | 84.8 | 96.5 | — | |
| COVERPretrain=ImageNet21k, Finetune=K600+SSv2+MiT+ImNet, Views=1×3, Base Architecture=TimeSFormer2021.12 | 84.5 | — | — | |
| R3D-RSPre-training=WTS2022.12 | 84.3 | — | — | |
| MVIT-BBackbone=MVIT-B2022.12 | 83.8 | 96.3 | — | |
| VATTPretrain=AudioSet+Videos, Finetune=K600, Views=4x32021.12 | 83.6 | — | — | |
| ViViTPretrain=ImageNet21k, Finetune=K600, Views=4×32021.12 | 83 | — | — | |
| ViViT-L FEBackbone=ViViT-L2022.12 | 82.9 | 94.6 | — | |
| MFormer-HRBackbone=MFormer-HR2022.12 | 82.7 | 96.1 | — | |
| TimeSFormerPretrain=ImageNet21k, Finetune=K600, Views=1×32021.12 | 82.2 | — | — | |
| TimeSformer-LBackbone=TimeSformer-L2022.12 | 82.2 | 95.6 | — | |
| X3D-XLBackbone=X3D-XL2022.12 | 81.9 | 95.5 | — | |
| SlowFast R101-NLBackbone=ResNet-1012022.12 | 81.8 | 95.1 | — | |
| SlowFast101Input Size=80x224^2, FLOPs (T)=7.0, Param (M)=602023.03 | 81.8 | 95.1 | — | |
| BDC-CLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 78.2 | 95.7 | — | |
| TC-CLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 78.1 | 95.7 | — | |
| SimVAWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 78.1 | 95.7 | — | |
| IMP-MoE-LPPT=350M, TPU-DAYS=1.5k, Zero-shot=true2023.05 | 76.8 | — | — | |
| SimVAWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 76.5 | 94.9 | — | |
| BDC-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 75.9 | 94.8 | — | |
| TC-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 75.4 | 94.7 | — | |
| STDDSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 75.1 | — | — | |
| OSTWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 75.1 | 94.6 | — | |
| FROSTERSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 74.8 | — | — | |
| FROSTERWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 74.8 | — | — | |
| ViFi-CLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 73.9 | 93.3 | — | |
| Open-MeDeSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 73.7 | — | — | |
| Open-VCLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 73 | — | — | |
| Open-VCLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 73 | 93.2 | — | |
| InternVideo2_clip-1B#F=8, Protocol=Zero-shot2024.03 | 72.8 | — | 81.8 | |
| InternVideo2Protocol=Zero-Shot2026.03 | 72.8 | — | — | |
| EZ-CLIPBackbone=ViT-14, Input size=8 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 72.1 | — | — | |
| InternVideo2_clip-6B#F=8, Protocol=Zero-shot2024.03 | 71.7 | — | 81.2 | |
| MAXIWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 71.5 | 92.5 | — | |
| ViFi CLIPInput size=32 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 71.2 | — | — | |
| ViFi-CLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 71.2 | — | — | |
| EZ-CLIPBackbone=ViT-16, Input size=16 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 71.1 | — | — | |
| ViFi-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 70.7 | 92.1 | — | |
| VideoCoCaPPT=2B, TPU-DAYS=10.5k, Zero-shot=true2023.05 | 70.1 | — | — | |
| EZ-CLIPBackbone=ViT-16, Input size=8 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 70.1 | — | — | |
| MoTEDWSE=false, Backbone Status=frozen, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 69.9 | — | — | |
| InternVL-6B#F=8, Protocol=Zero-shot2024.03 | 68.9 | — | 78.8 | |
| Qwen2.5-VL-7BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 68 | — | — | |
| ActionCLIPInput size=32 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 67.7 | — | — | |
| ActionCLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 67.5 | 90.7 | — | |
| Vita-CLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 67.4 | — | — | |
| Vita-CLIPWSE=false, Backbone Status=frozen, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 67.4 | — | — | |
| EZ-CLIPBackbone=ViT-32, Input size=8 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 67 | — | — | |
| IMP-MoE-BPPT=90M, TPU-DAYS=150, Zero-shot=true2023.05 | 65.7 | — | — | |
| XCLIPInput size=32 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 65.2 | — | — | |
| X-CLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 65.2 | — | — | |
| X-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 65.2 | 86.1 | — | |
| ActionCLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 62.5 | — | — | |
| ViCLIP-L#F=8, Protocol=Zero-shot2024.03 | 62.2 | — | 73.5 | |
| IMP-BPPT=86M, TPU-DAYS=120, Zero-shot=true2023.05 | 62.1 | — | — | |
| ST-AdapterSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 60.2 | — | — | |
| Vanilla CLIPInput size=32 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 59.8 | — | — | |
| ActionCLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 56.1 | 83.2 | — | |
| A5Input size=32 x 224 x 224, Zero-shot=true, Training set=Kinetics-4002023.12 | 55.8 | — | — | |
| A5WSE=false, Backbone Status=frozen, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 55.8 | 81.4 | — | |
| CLIP#F=8, Protocol=Zero-shot2024.03 | 55.1 | — | 67.2 | |
| Qwen2.5-VL-3BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 37.7 | — | — | |
| EVA-CLIP-18B#F=16, Protocol=Zero-shot2024.03 | — | — | 79.4 | |
| EVA-CLIP-E#F=1, Protocol=Zero-shot2024.03 | — | — | 69.3 | |
| EVA-CLIP-L#F=1, Protocol=Zero-shot2024.03 | — | — | 64.9 |