Action Recognition on UCF101 (Split 1)
96.8Top-1 AccSupervised
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SupervisedBackbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 96.8 | — | — | |
| Supervised PretrainingPretrain=Kinetics, Backbone=R(2+1)D, Strategy=Supervised Pretraining, N x H/W=16x1122026.06 | 96.8 | — | — | |
| VicTRk (shots)=16, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 95.8 | — | — | |
| GDTEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=IG65M (21y), Modality=VA2020.08 | 95.2 | — | — | |
| MMVEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS+HT (16y), Modality=VAT2020.08 | 95.2 | — | — | |
| SupervisedBackbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 95 | — | — | |
| X-Florencek (shots)=16, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 94.8 | — | — | |
| XDCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=IG65M (21y), Modality=VA2020.08 | 94.2 | — | — | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-152(2x)2020.08 | 93.9 | — | — | |
| EloEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=YT8M (13y), Modality=VFA2020.08 | 93.8 | — | — | |
| BraVeCompute=16 TPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^2, Note=pretrained with very high temporal resolutions (2 views of 32 & 128 frames)2021.11 | 93.6 | — | — | |
| VicTRk (shots)=8, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 93.6 | — | — | |
| CM-ACCCompute=40 GPUs, Backbone=R(2+1)D-18 (33.4), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 93.5 | — | — | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-502020.08 | 93.4 | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 93 | — | — | |
| GDTEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 92.5 | — | — | |
| X-Florencek (shots)=8, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 92.5 | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 92.4 | — | — | |
| VicTRk (shots)=4, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 92.3 | — | — | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V, Backbone=R3D-502020.08 | 92.2 | — | — | |
| MMVEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=AS+HT (16y), Modality=VAT2020.08 | 91.8 | — | — | |
| XDCPretraining Dataset=IG-Kinetics, Pretraining Size=65M2019.11 | 91.5 | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 91.5 | — | — | |
| MMVCompute=32 TPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 91.5 | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 91.5 | — | — | |
| X-CLIPk (shots)=16, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 91.4 | — | — | |
| MIL-NCEEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=HT (15y), Modality=VT2020.08 | 91.3 | — | — | |
| XDCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 91.2 | — | — | |
| MMV-VAEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS+HT (16y), Modality=VA2020.08 | 91.1 | — | — | |
| SupervPretraining Dataset=Kinetics, Pretraining Size=240K2019.11 | 90.9 | — | — | |
| GDTCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 90.9 | — | — | |
| CoCLREvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=VF2020.08 | 90.6 | — | — | |
| CVRLEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-502020.08 | 90.6 | — | — | |
| COCLR†Input Size=32 x 128x128, Arch=S3D-23, Modality=RGB + Optical Flow2022.06 | 90.6 | — | — | |
| CMACCompute=8 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 90.3 | — | — | |
| CM-ACCCompute=40 GPUs, Backbone=3D-ResNet18 (33.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^2, Dataset samples=240K samples from Kinetics7002021.11 | 90.2 | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=8 x 224^22021.11 | 89.4 | — | — | |
| TimeSformerk (shots)=16, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 89.4 | — | — | |
| CVRLEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K400 (28d), Modality=V, Backbone=R3D-502020.08 | 89.2 | — | — | |
| AVTSEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 89 | — | — | |
| XDCPretraining Dataset=IG-Random, Pretraining Size=65M2019.11 | 88.8 | — | — | |
| Video-Swin-Bk (shots)=16, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 88.7 | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=8 x 224^22021.11 | 88.6 | — | — | |
| X-Florencek (shots)=4, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 88.5 | — | — | |
| CrissCrossCompute=4 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics-Sound, Finetune input=32 x 224^22021.11 | 88.3 | — | — | |
| X-CLIPk (shots)=8, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 88.3 | — | — | |
| DynamoNetEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=YT8M (13y), Modality=V2020.08 | 88.1 | — | — | |
| COCLR-RGBInput Size=32 x 128x128, Arch=S3D-23, Modality=RGB2022.06 | 87.9 | — | — | |
| Supervised PretrainingPretrain=Kinetics, Backbone=R3D-18, Strategy=Supervised Pretraining, N x H/W=16x1122026.06 | 87.8 | — | — | |
| VicTRk (shots)=2, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 87.7 | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 87.5 | — | — | |
| SupervisedBackbone=3D-ResNet18 (33.4), Pre-trained Dataset=Kinetics-Sound, Finetune input=32 x 224^22021.11 | 86.9 | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 86.9 | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 86.8 | — | — | |
| SLIC†Input Size=32 x 128x128, Arch=R3D-18, Modality=RGB + Optical Flow, Pretraining Frames=162022.06 | 86.3 | — | — | |
| MMV-VAEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=AS+HT (16y), Modality=VA2020.08 | 86.2 | — | — | |
| Video-Swin-Bk (shots)=8, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 85.8 | — | — | |
| DistInitPretrain=Kinetics+Sports-1M, Backbone=R(2+1)D-18, Strategy=DistInit [6], N x H/W=32x1122026.06 | 85.7 | — | — | |
| Robust-xIDCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 85.6 | — | — | |
| XDCEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 85.3 | — | — | |
| XDCPretraining Dataset=AudioSet, Pretraining Size=2M2019.11 | 84.9 | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=8 x 224^22021.11 | 84.9 | — | — | |
| TCLRPretrain=Kinetics, Backbone=R3D-18, Strategy=TCLR [27], N x H/W=16x1122026.06 | 84.1 | — | — | |
| SupervPretraining Dataset=AudioSet, Pretraining Size=2M2019.11 | 84 | — | — | |
| X-Florencek (shots)=2, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 84 | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 83.7 | — | — | |
| TimeSformerk (shots)=8, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 83.7 | — | — | |
| MIL-NCEEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=HT (15y), Modality=VT2020.08 | 83.4 | — | — | |
| X-CLIPk (shots)=4, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 83.4 | — | — | |
| SLICInput Size=32 x 128x128, Arch=R3D-18, Modality=RGB, Pretraining Frames=162022.06 | 83.2 | — | — | |
| SeLaViCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 83.1 | — | — | |
| TCLRPretrain=UCF, Backbone=R3D-18, Strategy=TCLR [27], N x H/W=16x1122026.06 | 82.4 | — | — | |
| Supervised PretrainingPretrain=Sports-1M, Backbone=C3D, Strategy=Supervised Pretraining, N x H/W=16x1122026.06 | 82.3 | — | — | |
| Robust-xIDCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 81.9 | — | — | |
| Supervised PretrainingPretrain=Kinetics, Backbone=R3D-18, Strategy=Supervised Pretraining, N x H/W=8x2242026.06 | 81.7 | — | — | |
| SpeedNetEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 81.1 | — | — | |
| SpeedNetPretrain=Kinetics, Backbone=S3D-G, Strategy=SpeedNet [22], N x H/W=64x2242026.06 | 81.1 | — | — | |
| SupervPretraining Dataset=ImageNet, Pretraining Size=1.2M2019.11 | 79.9 | — | — | |
| CBTEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600+ (273d), Modality=V2020.08 | 79.5 | — | — | |
| VideoMoCoPretrain=Kinetics, Backbone=R(2+1)D-18, Strategy=VideoMoCo [26], N x H/W=32x1122026.06 | 78.7 | — | — | |
| CoCon-E*†Input Size=224x224, Arch=R3D-18, Modality=RGB + Optical Flow2022.06 | 78.1 | — | — | |
| CoCLREvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K400 (28d), Modality=VF2020.08 | 77.8 | — | — | |
| XDCPretraining Dataset=AudioSet-240K, Pretraining Size=240K2019.11 | 77.4 | — | — | |
| CM-ACCCompute=40 GPUs, Backbone=3D-ResNet18 (33.4), Pre-trained Dataset=Kinetics-Sound, Finetune input=32 x 224^22021.11 | 77.2 | — | — | |
| PacePredEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 77.1 | — | — | |
| PacePredPretrain=Kinetics, Backbone=R(2+1)D-18, Strategy=PacePred [44], N x H/W=16x1122026.06 | 77.1 | — | — | |
| DANetPretrain=UCF/HMDB, Backbone=R3D-18, Strategy=DANet [5], N x H/W=8x1122026.06 | 76.8 | — | — | |
| SupervPretraining Dataset=AudioSet-240K, Pretraining Size=240K2019.11 | 76.6 | — | — | |
| X-CLIPk (shots)=2, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 76.4 | — | — | |
| DPCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 75.7 | — | — | |
| TimeSformerk (shots)=4, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 75.6 | — | — | |
| ImageNet InflationPretrain=None, Backbone=R3D-18, Strategy=ImageNet Inflation, N x H/W=16x1122026.06 | 74.3 | — | — | |
| XDCPretraining Dataset=Kinetics, Pretraining Size=240K2019.11 | 74.2 | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 74.2 | — | — | |
| Video-Swin-Bk (shots)=4, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 74.1 | — | — | |
| VideoMoCoPretrain=Kinetics, Backbone=R3D-18, Strategy=VideoMoCo [26], N x H/W=32x1122026.06 | 74.1 | — | — | |
| LEViLPretrain=UCF+HMDB+Kineticsb, Backbone=R3D-18, Strategy=LEViLc, N x H/W=8x2242026.06 | 72.5 | — | — | |
| ClipOrderEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 72.4 | — | — | |
| ClipOrderPretrain=UCF, Backbone=R(2+1)D-18, Strategy=ClipOrder [25], N x H/W=16x1122026.06 | 72.4 | — | — | |
| CoCon-RGB*Input Size=224x224, Arch=R3D-18, Modality=RGB2022.06 | 71.6 | — | — |