Video Action Recognition on HMDB-51 (3 splits)
84.6AccuracySCT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| SCT-LPretrain=K4002021.08 | 84.6 | |
| SMARTPretrain=ImageNet+K400, Modalities=RGB+Flow2022.08 | 84.3 | |
| SlowOnly-R101-RGB + I3D-FlowPretrain=OmniSource, Modalities=RGB+Flow2022.08 | 83.8 | |
| EVL ViT-L/14Pretrain=CLIP+K400, Modalities=RGB, Resolution=224px2022.08 | 83.6 | |
| SCT-MPretrain=K4002021.08 | 83.2 | |
| PERF-NetPretrain=ImageNet+K700, Modalities=RGB+Flow+Pose2022.08 | 83.2 | |
| EVL ViT-L/14@336pxPretrain=CLIP+K400, Modalities=RGB, Resolution=336px2022.08 | 83.2 | |
| SCT-SPretrain=K4002021.08 | 81.5 | |
| SCT-LPretrain=ImageNet2021.08 | 81.4 | |
| Two-Stream I3DPre-training=Kinetics 300k2017.11 | 80.7 | |
| I3DVideo Input Type=Decoded, Input Modality=RGB + Flow, Backbone Architecture=I3D2019.01 | 80.7 | |
| I3D_RGB+FlowBackbone=3D Inception2021.03 | 80.7 | |
| I3DRGB+FlowBackbone=3D Inception2021.03 | 80.7 | |
| Two-Stream I3DPretrain=ImageNet+K400, Modalities=RGB+Flow2022.08 | 80.7 | |
| Two-Stream LGD-3DPretrain=ImageNet+K600, Modalities=RGB+Flow2022.08 | 80.5 | |
| SlowOnly-R101Pretrain=OmniSource, Modalities=RGB2022.08 | 79 | |
| R(2+1)DVideo Input Type=Decoded, Input Modality=RGB + Flow2019.01 | 78.7 | |
| I3D RGB + DMC-Net (I3D)Video Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Spatio-temporal modeling, Backbone Architecture=I3D + DMC-Net2019.01 | 77.8 | |
| BQNBackbone=TSM R502021.03 | 77.6 | |
| BQNBackbone=TSM R50, Inference Protocol=3 crops x 2 clips2021.03 | 77.6 | |
| PAN_FullBackbone=TSM R502021.03 | 77 | |
| PAN FullBackbone=TSM R502021.03 | 77 | |
| SCT-SPretrain=ImageNet2021.08 | 76.5 | |
| S3DVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Spatio-temporal modeling2019.01 | 75.9 | |
| S3D-GPretrain=K4002021.08 | 75.9 | |
| S3DPretrain=ImageNet+K400, Modalities=RGB2022.08 | 75.9 | |
| LGD-3DPretrain=K6002021.08 | 75.7 | |
| FASTER32Pretrain=K400, Modalities=RGB2022.08 | 75.7 | |
| LGD-3DPretrain=ImageNet+K600, Modalities=RGB2022.08 | 75.7 | |
| pBYOL (p = 4)Backbone=S3D-G, Modality=R, Pretrain=K4002022.12 | 75 | |
| I3D RGBVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Spatio-temporal modeling, Backbone Architecture=I3D2019.01 | 74.8 | |
| I3DPretrain=ImageNet+K400, Modalities=RGB2022.08 | 74.8 | |
| SCEBackbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=162022.12 | 74.7 | |
| MF-NetVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Spatio-temporal modeling2019.01 | 74.6 | |
| I3DPretrain=K4002021.08 | 74.5 | |
| R(2+1)DPretrain=K4002021.08 | 74.5 | |
| R(2+1)D-34Pretrain=K400, Modalities=RGB2022.08 | 74.5 | |
| BraVeBackbone=ResNet3D-50, Modality=R+F, Pretrain=K6002022.12 | 74.3 | |
| OFF2017.11 | 74.2 | |
| BraVeBackbone=ResNet3D-50, Modality=R, Pretrain=K6002022.12 | 74 | |
| pBYOL (p = 4)Backbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=162022.12 | 73.6 | |
| TSMBackbone=R502021.03 | 73.5 | |
| TSMBackbone=R502021.03 | 73.5 | |
| TEABackbone=R502021.03 | 73.3 | |
| TEABackbone=R502021.03 | 73.3 | |
| ST-VLMPF+iDT2017.11 | 73.1 | |
| BraVeBackbone=ResNet3D-50, Modality=R+F, Pretrain=K4002022.12 | 72.7 | |
| STCPretrain=K400, Modalities=RGB2022.08 | 72.6 | |
| DI Four-StreamBackbone=ResNeXt1012021.03 | 72.5 | |
| DI Four-StreamBackbone=ResNeXt1012021.03 | 72.5 | |
| STMN+iDT2017.11 | 72.2 | |
| STMBackbone=R502021.03 | 72.2 | |
| STMBackbone=R502021.03 | 72.2 | |
| pBYOL (p = 4)Backbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=82022.12 | 72.1 | |
| BraVeBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 72 | |
| ConST-CLBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 71.9 | |
| DMC-Net (I3D)Video Input Type=Compressed, Backbone Architecture=I3D2019.01 | 71.8 | |
| TVNetVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Motion representation learning2019.01 | 71 | |
| TVNetBackbone=BNInception2021.03 | 71 | |
| TVNetBackbone=BNInception2021.03 | 71 | |
| ARTNetVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Spatio-temporal modeling2019.01 | 70.9 | |
| SCEBackbone=ResNet3D-50, Modality=R, Pretrain=K400, Te=82022.12 | 70.5 | |
| ResNeXtPretrain=K4002021.08 | 70.2 | |
| Three-Stream TSN2017.11 | 69.4 | |
| STP2017.11 | 68.9 | |
| Two-Stream TSN2017.11 | 68.5 | |
| TSN_RGB+FlowBackbone=BNInception2021.03 | 68.5 | |
| TSNRGB+FlowBackbone=BNInception2021.03 | 68.5 | |
| ECOPretrain=K400, Modalities=RGB2022.08 | 68.4 | |
| CVRLBackbone=ResNet3D-50, Modality=R, Pretrain=K6002022.12 | 68 | |
| CORPBackbone=ResNet3D-50, Modality=R+F, Pretrain=K4002022.12 | 68 | |
| CVRLBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 66.7 | |
| SCEBackbone=ResNet3D-18, Modality=R, Pretrain=K400, Frames=162022.12 | 66.6 | |
| Two-Stream I3D2017.11 | 66.4 | |
| VideoPromptPretrain=CLIP, Modalities=RGB2022.08 | 66.4 | |
| L2STM2017.11 | 66.2 | |
| TDD+iDT2017.11 | 65.9 | |
| SCEBackbone=ResNet3D-18, Modality=R, Pretrain=K400, Frames=82022.12 | 65.7 | |
| Two-Stream fusionVideo Input Type=Decoded, Input Modality=RGB + Flow2019.01 | 65.4 | |
| LTC+iDT2017.11 | 64.8 | |
| TransRankBackbone=R(2+1)D-18, Modality=R+RD, Pretrain=K2002022.12 | 64.2 | |
| TECBackbone=ResNet3D-18, Modality=R, Pretrain=K4002022.12 | 63.6 | |
| TECBackbone=S3D-G, Modality=R, Pretrain=K4002022.12 | 63.5 | |
| TransRankBackbone=ResNet3D-18, Modality=R+RD, Pretrain=K2002022.12 | 63.5 | |
| KVMDF2017.11 | 63.3 | |
| TransRankBackbone=ResNet3D-18, Modality=R+RD, Pretrain=UCF1012022.12 | 63 | |
| CoCLRBackbone=S3D, Modality=R+F, Pretrain=K4002022.12 | 62.9 | |
| DMC-Net (ResNet-18)Video Input Type=Compressed, Backbone Architecture=ResNet-182019.01 | 62.8 | |
| PWC-Net (ResNet-18) + CoViARVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Motion representation learning, Backbone Architecture=ResNet-182019.01 | 62.2 | |
| TECBackbone=R(2+1)D-18, Modality=R, Pretrain=K4002022.12 | 62.2 | |
| SCEBackbone=ResNet3D-18, Modality=R, Pretrain=K2002022.12 | 62 | |
| CATEBackbone=ResNet3D-50, Modality=R, Pretrain=K4002022.12 | 61.9 | |
| iDT2017.11 | 61.7 | |
| TransRankBackbone=R(2+1)D-18, Modality=R, Pretrain=K2002022.12 | 60.1 | |
| Two-Stream2017.11 | 59.4 | |
| Two-streamVideo Input Type=Decoded, Input Modality=RGB + Flow2019.01 | 59.4 | |
| ProViCoBackbone=ResNet3D-18, Modality=R, Pretrain=K4002022.12 | 59.4 | |
| CoVIARVideo Input Type=Compressed2019.01 | 59.1 | |
| TransRankBackbone=ResNet3D-18, Modality=R, Pretrain=K2002022.12 | 58.1 | |
| ActionFlowNetVideo Input Type=Decoded, Input Modality=RGB, Temporal Modeling Approach=Motion representation learning2019.01 | 56.4 |