Action Recognition on UCF101 (3 splits)
98.6AccuracyZeroI2V
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ZeroI2VPretrain=CLIP+K400, Backbone=ViT-L/14, Evaluation Protocol=PETL2023.10 | 98.6 | — | |
| LGD-3D Two-streamPretraining=ImageNet+Kinetics-6002019.06 | 98.2 | — | |
| MUFI+fine-tuningBackbone=ResNet-50, Pre-train=Multi-Faceted, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 98.1 | — | |
| ST-AdapterPretrain=CLIP+K400, Backbone=ViT-L/14, Evaluation Protocol=PETL2023.10 | 98.1 | — | |
| Two-Stream I3DPre-training=Kinetics 300k2017.11 | 98 | — | |
| I3D Two-streamPretraining=ImageNet+Kinetics-4002019.06 | 97.9 | — | |
| ZeroI2VPretrain=CLIP, Backbone=ViT-L/14, Evaluation Protocol=PETL2023.10 | 97.8 | — | |
| ZeroI2VPretrain=CLIP+K400, Backbone=ViT-B/16, Evaluation Protocol=PETL2023.10 | 97.7 | — | |
| R(2+1)D Two-streamPretraining=Kinetics-4002019.06 | 97.3 | — | |
| SlowOnly-8x8-R101Pretrain=Kinetics+OmniSource, Evaluation Protocol=full fine-tuning2023.10 | 97.3 | — | |
| LGD-3D RGBPretraining=ImageNet+Kinetics-6002019.06 | 97 | — | |
| LGD-3DBackbone=ResNet-101, Pre-train=Kinetics-600, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 97 | — | |
| R(2+1)D RGBPretraining=Kinetics-4002019.06 | 96.8 | — | |
| S3D-G RGBPretraining=ImageNet+Kinetics-4002019.06 | 96.8 | — | |
| LGD-3D FlowPretraining=ImageNet+Kinetics-6002019.06 | 96.8 | — | |
| SupervisedProtocol=Fine-Tuning2020.06 | 96.8 | — | |
| R(2+1)DBackbone=ResNet-34, Pre-train=Kinetics-400, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 96.8 | — | |
| S3D-GBackbone=BN-Inception, Pre-train=Kinetics-400, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 96.8 | — | |
| S3DPretrain=ImageNet+K400, Evaluation Protocol=full fine-tuning2023.10 | 96.8 | — | |
| ST-AdapterPretrain=CLIP+K400, Backbone=ViT-B/16, Evaluation Protocol=PETL2023.10 | 96.4 | — | |
| pBYOL (p = 4)Backbone=S3D-G, Modality=R, Pretrain=K4002022.12 | 96.3 | — | |
| STMBackbone=ResNet-50, Pre-train=Kinetics-400, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 96.2 | — | |
| OFF2017.11 | 96 | — | |
| MUFI+linearBackbone=ResNet-50, Pre-train=Multi-Faceted, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 95.7 | — | |
| TLE:Bilinear2018.09 | 95.6 | — | |
| I3DPretrain=ImageNet+K400, Evaluation Protocol=full fine-tuning2023.10 | 95.6 | — | |
| ZeroI2VPretrain=CLIP, Backbone=ViT-B/16, Evaluation Protocol=PETL2023.10 | 95.6 | — | |
| R(2+1)D FlowPretraining=Kinetics-4002019.06 | 95.5 | — | |
| pBYOL (p = 4)Backbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=162022.12 | 95.5 | — | |
| I3D RGBPretraining=ImageNet+Kinetics-4002019.06 | 95.4 | — | |
| I3D FlowPretraining=ImageNet+Kinetics-4002019.06 | 95.4 | — | |
| I3DBackbone=BN-Inception, Pre-train=Kinetics-400, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 95.4 | — | |
| SCEBackbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=162022.12 | 95.3 | — | |
| GDTBackbone=R(2+1)D-18, Params=33.3M, Train data=IG65M, Years=21, Modality=VA, Protocol=Linear2020.06 | 95.2 | — | |
| MMV FACBackbone=TSM-50x2, Params=93.9M, Train data=AS+HT, Years=16, Modality=VAT, Protocol=Fine-Tuning2020.06 | 95.2 | — | |
| BraVeBackbone=ResNet3D-50, Modality=R+F, Pretrain=K6002022.12 | 95.1 | — | |
| STMN+iDT2017.11 | 94.9 | — | |
| MMV FACBackbone=TSM-50, Params=23.5M, Train data=AS+HT, Years=16, Modality=VAT, Protocol=Fine-Tuning2020.06 | 94.9 | — | |
| ConST-CLBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 94.8 | — | |
| BraVeBackbone=ResNet3D-50, Modality=R+F, Pretrain=K4002022.12 | 94.7 | — | |
| STP2017.11 | 94.6 | — | |
| Spatiotemporal Pyramid Net2018.09 | 94.6 | — | |
| ResNeXt-101 RGBPretraining=Kinetics-4002019.06 | 94.5 | — | |
| ST-VLMPF+iDT2017.11 | 94.3 | — | |
| TSN+TSMAttention=with2018.09 | 94.3 | — | |
| ARTNetBackbone=BN-Inception, Pre-train=Kinetics-400, Evaluation Protocol=Linear/Fine-tuning Protocol2022.01 | 94.3 | — | |
| Three-Stream TSN2017.11 | 94.2 | — | |
| Spatiotemporal Multiplier Nets2018.09 | 94.2 | — | |
| TSNPretraining=ImageNet2019.06 | 94.2 | — | |
| XDCBackbone=R(2+1)D-18, Params=33.3M, Train data=IG65M, Years=21, Modality=VA, Protocol=Linear2020.06 | 94.2 | — | |
| pBYOL (p = 4)Backbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=82022.12 | 94.2 | — | |
| TSN+TSMAttention=without2018.09 | 94.1 | — | |
| BraVeBackbone=ResNet3D-50, Modality=R, Pretrain=K6002022.12 | 94.1 | — | |
| SCEBackbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=82022.12 | 94.1 | — | |
| Two-Stream TSN2017.11 | 94 | — | |
| TSNBackbone=BN-Inception2018.09 | 94 | — | |
| ELoBackbone=R(2+1)D-50, Params=46.9M, Train data=YT8M, Years=13, Modality=VFA, Protocol=Linear2020.06 | 93.8 | — | |
| P3D ResNet + IDTEvaluation Protocol=Method fusion with IDT2017.11 | 93.7 | — | |
| Hierarchical Attention Nets2018.09 | 93.7 | — | |
| BraVeBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 93.7 | — | |
| L2STM2017.11 | 93.6 | — | |
| ActionVLAD+iDTBackbone=VGG162018.09 | 93.6 | — | |
| VideoPromptPretrain=CLIP, Evaluation Protocol=full fine-tuning2023.10 | 93.6 | — | |
| Fusion+iDT2018.09 | 93.5 | — | |
| CORPBackbone=ResNet3D-50, Modality=R+F, Pretrain=K4002022.12 | 93.5 | — | |
| Two-Stream I3D2017.11 | 93.4 | — | |
| Spatiotemporal ResNets2018.09 | 93.4 | — | |
| CVRLBackbone=ResNet3D-50, Modality=R, Pretrain=K6002022.12 | 93.4 | — | |
| pMoCo (p = 2)Backbone=ResNet3D-50, Modality=R, Pretrain=K400, Frames=162022.12 | 93.3 | — | |
| KVMDF2017.11 | 93.1 | — | |
| Key Volume Mining2018.09 | 93.1 | — | |
| pBYOL (p = 2)Backbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 92.7 | — | |
| Multi-Stream Fusion2018.09 | 92.6 | — | |
| Two-Stream CNN Fusion2018.09 | 92.5 | — | |
| GDTBackbone=R(2+1)D-18, Params=33.3M, Train data=AS, Years=1, Modality=VA, Protocol=Linear2020.06 | 92.5 | — | |
| MMV FACBackbone=S3D-G, Params=9.1M, Train data=AS+HT, Years=16, Modality=VAT, Protocol=Fine-Tuning2020.06 | 92.5 | — | |
| CVRLBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 92.2 | — | |
| ResNet-152 + IDTEvaluation Protocol=Method fusion with IDT2017.11 | 92 | — | |
| MMV FACBackbone=TSM-50x2, Params=93.9M, Train data=AS+HT, Years=16, Modality=VAT, Protocol=Linear2020.06 | 91.8 | — | |
| LTC+iDT2017.11 | 91.7 | — | |
| TDD + IDTEvaluation Protocol=Method fusion with IDT2017.11 | 91.5 | — | |
| TDD+iDT2017.11 | 91.5 | — | |
| VideoLSTM+iDT(FV)2018.09 | 91.5 | — | |
| AVIDBackbone=R(2+1)D-50, Params=46.9M, Train data=AS, Years=1, Modality=VA, Protocol=Linear2020.06 | 91.5 | — | |
| VA onlyBackbone=R(2+1)D-18, Params=33.3M, Train data=AS, Years=1, Modality=VA, Protocol=Fine-Tuning2020.06 | 91.5 | — | |
| MMV FACBackbone=TSM-50, Params=23.5M, Train data=AS+HT, Years=16, Modality=VAT, Protocol=Linear2020.06 | 91.5 | — | |
| Two-Stream CNNBackbone=VGG162018.09 | 91.4 | — | |
| MIL-NCEBackbone=S3D-G, Params=9.1M, Train data=HT, Years=15, Modality=VT, Protocol=Fine-Tuning2020.06 | 91.3 | — | |
| XDCBackbone=R(2+1)D-18, Params=33.3M, Train data=AS, Years=1, Modality=VA, Protocol=Linear2020.06 | 91.2 | — | |
| VA onlyBackbone=S3D-G, Params=9.1M, Train data=AS+HT, Years=16, Modality=VA, Protocol=Fine-Tuning2020.06 | 91.1 | — | |
| pMoCo (p = 2)Backbone=ResNet3D-50, Modality=R, Pretrain=K400, Frames=82022.12 | 91 | — | |
| SCEBackbone=ResNet3D-18, Modality=R, Pretrain=K400, Frames=82022.12 | 90.9 | — | |
| Multi-Granular Nets2018.09 | 90.8 | — | |
| TransRankBackbone=R(2+1)D-18, Modality=R+RD, Pretrain=K2002022.12 | 90.7 | — | |
| CoCLRBackbone=S3D, Modality=R+F, Pretrain=K4002022.12 | 90.6 | — | |
| C3D + IDTEvaluation Protocol=Method fusion with IDT2017.11 | 90.4 | — | |
| C3D+iDT2018.09 | 90.4 | — | |
| VA onlyBackbone=S3D-G, Params=9.1M, Train data=AS, Years=1, Modality=VA, Protocol=Fine-Tuning2020.06 | 90.1 | — | |
| MMV FACBackbone=S3D-G, Params=9.1M, Train data=AS+HT, Years=16, Modality=VAT, Protocol=Linear2020.06 | 89.6 | — | |
| TransRankBackbone=ResNet3D-18, Modality=R+RD, Pretrain=K2002022.12 | 89.6 | — |