Video Action Recognition on Kinetics-600
89.8Top-1 AccEVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVAprotocol=fine-tuning2022.11 | 89.8 | — | |
| EVAPre-training Data=K-722 (merged K-400, K-600, K-700)2022.11 | 89.8 | — | |
| mPLUG-2Setting=Fine-tuning2023.02 | 89.8 | 98.3 | |
| CoCaEvaluation Protocol=finetuned2022.05 | 89.4 | — | |
| CoCaEvaluation Protocol=finetuned2022.11 | 89.4 | — | |
| CoCaEvaluation Protocol=frozen2022.05 | 88.5 | — | |
| CoCaEvaluation Protocol=frozen2022.11 | 88.5 | — | |
| MaskFeat2022.05 | 88.3 | — | |
| MaskFeatprotocol=fine-tuning2022.11 | 88.3 | — | |
| MaskFeat2022.11 | 88.3 | — | |
| X-CLIP2022.11 | 88.3 | — | |
| Florence2022.05 | 88 | — | |
| Florence2022.11 | 88 | — | |
| CoVeR2022.05 | 87.9 | — | |
| CoVeR2022.11 | 87.9 | — | |
| CoVeRSetting=Fine-tuning2023.02 | 87.9 | 97.8 | |
| FlorencePretraining Data=FLD-900M, Views=4 x 3, Params=647M2021.11 | 87.8 | 97.8 | |
| FlorencePretraining Data=FLD-900M, Views=4 x 3, Params=647M2021.11 | 87.8 | 97.8 | |
| Florenceprotocol=fine-tuning2022.11 | 87.8 | — | |
| FlorenceSetting=Fine-tuning2023.02 | 87.8 | 97.8 | |
| mPLUG-2BaseSetting=Fine-tuning2023.02 | 86.7 | 97.2 | |
| TokenLearner 16at18+L/10Pretraining Data=JFT-300M, Views=4 x 3, Params=460M2021.11 | 86.3 | 97 | |
| TokenLearner 16at18+L/10Pretraining Data=JFT-300M, Views=4 x 3, Params=460M2021.11 | 86.3 | 97 | |
| TokenLearnerSetting=Fine-tuning2023.02 | 86.3 | 97 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=10 x 5, Params=200M2021.11 | 86.1 | 97.3 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=10 x 5, Params=200M2021.11 | 86.1 | 97.3 | |
| VideoSwin-LSetting=Fine-tuning2023.02 | 86.1 | 97.3 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=4 x 3, Params=200M2021.11 | 85.9 | 97.1 | |
| VideoSwin-LPretraining Data=ImageNet-22K, Views=4 x 3, Params=200M2021.11 | 85.9 | 97.1 | |
| ViViT-H/16x2Pretraining Data=JFT-300M, Views=4 x 3, Params=648M2021.11 | 85.8 | 96.5 | |
| ViViT-H/16x2Pretraining Data=JFT-300M, Views=4 x 3, Params=648M2021.11 | 85.8 | 96.5 | |
| ViViT-HSetting=Fine-tuning2023.02 | 85.8 | 96.5 | |
| MoViNet2022.05 | 84.8 | — | |
| MoViNetSetting=Fine-tuning2023.02 | 84.8 | — | |
| ViViT2022.05 | 84.3 | — | |
| MVIT-B-24GFLOPS × views=236×1×52021.06 | 83.8 | 96.3 | |
| VATT2022.05 | 83.6 | — | |
| VATTSetting=Fine-tuning2023.02 | 83.6 | 96.6 | |
| ViViT-LPretrain=IN-21K, GFLOPS × views=3992×3×42021.06 | 83 | 95.7 | |
| Mformer-HRPretrain=IN-21K, GFLOPS × views=958.8×3×102021.06 | 82.7 | 96.1 | |
| Tformer-HRPretrain=IN-21K, GFLOPS × views=1703×3×12021.06 | 82.4 | 96 | |
| Mformer-LPretrain=IN-21K, GFLOPS × views=1185.1×3×102021.06 | 82.2 | 96 | |
| TimeSformer-LSetting=Fine-tuning2023.02 | 82.2 | 95.6 | |
| X3D-XLGFLOPS × views=48.4×3×102021.06 | 81.9 | 95.5 | |
| SlowFastGFLOPS × views=234×3×102021.06 | 81.8 | 95.1 | |
| MformerPretrain=IN-21K, GFLOPS × views=369.5×3×102021.06 | 81.6 | 95.6 | |
| LGD-3DPretrain=IN-1K2021.06 | 81.5 | 95.6 | |
| AttnNAS2021.06 | 79.8 | 94.4 |