Action Recognition on HMDB-51 (average of three splits)
87.2Top-1 AccMaxExp+IDT
Evaluation Results
| Method | Links | |
|---|---|---|
| MaxExp+IDTPooling Order=TO+, Auxiliary Descriptors=IDT2021.10 | 87.2 | |
| SCK(TO+) +IDTPooling Order=TO+, Auxiliary Descriptors=IDT2021.10 | 86.1 | |
| MaxExp+IDTPooling Order=SO+, Auxiliary Descriptors=IDT2021.10 | 85.7 | |
| SCK(SO+) +IDTPooling Order=SO+, Auxiliary Descriptors=IDT2021.10 | 85.1 | |
| SlowOnly-8x8-R101 + FlowPretrain=Kinetics + OmniSource2020.03 | 83.8 | |
| EvaNetType=Ensemble2018.11 | 82.3 | |
| I3D + PA3DPretrain=ImageNet + Kinetics2020.03 | 82.1 | |
| DSP2018.11 | 81.5 | |
| DSPBackbone=TS I3D2018.07 | 81.5 | |
| ADL+I3DAuxiliary Descriptors=I3D2021.10 | 81.5 | |
| Dicrim. Pooling2018.11 | 81.3 | |
| Top modelType=Individual2018.11 | 81.3 | |
| Full-FT I3DBackbone=I3D2021.10 | 81.3 | |
| MaxExpPooling Order=TO+2021.10 | 81.1 | |
| Two-stream I3D2018.11 | 80.9 | |
| PoTion2018.11 | 80.9 | |
| TS I3D2018.07 | 80.9 | |
| I3D + PoTionPretrain=ImageNet + Kinetics2020.03 | 80.9 | |
| HDPPooling Order=TO+2021.10 | 80.9 | |
| Two-stream I3DDim=3D2017.11 | 80.7 | |
| I3D two-streamBackbone=3D Inception-v1, Flow=true, Pre-train Data=ImageNet+Kinetics2019.08 | 80.7 | |
| Two-Stream-I3DPretrain=ImageNet + Kinetics2020.03 | 80.7 | |
| MaxExpPooling Order=SO+2021.10 | 80.3 | |
| iTGM-EnsembleType=Ensemble2018.11 | 80.1 | |
| HDPPooling Order=SO+2021.10 | 80.1 | |
| 3D-EnsembleType=Ensemble2018.11 | 79.9 | |
| SlowOnly-8x8-R101Pretrain=Kinetics + OmniSource2020.03 | 79 | |
| R(2+1)D2018.11 | 78.7 | |
| TCM-R50Pretrain=Kinetics, Backbone=ResNet502022.02 | 77.5 | |
| Flow-I3DPretrain=ImageNet + Kinetics2020.03 | 77.1 | |
| TDNPretrain=Kinetics, Backbone=ResNet502022.02 | 76.3 | |
| (no EPN)Pooling Order=SO+2021.10 | 76.1 | |
| Fully-supervised SOTABackbone=S3D, Frozen=false2019.12 | 75.9 | |
| S3D-GInput=64 x 3 x 224 x 224, Clips=ALL, Backbone=Inception2020.06 | 75.9 | |
| S3DPretrain=Kinetics, Backbone=Inception V22022.02 | 75.9 | |
| R(2+1)D-RGB & DSNInput=32 x 3 x 112 x 112, Clips=4, M=12020.06 | 75.5 | |
| RGB-I3DPre-train dataset=ImageNet+Kinetics, Spatial resolution=224 x 224, Backbone architecture=Inception V12017.11 | 74.8 | |
| RGB-I3DPretrain=ImageNet + Kinetics2020.03 | 74.8 | |
| I3D-RGBInput=64 x 3 x 224 x 224, Clips=ALL, Backbone=Inception V12020.06 | 74.8 | |
| R(2+1)D-RGBInput=32 x 3 x 112 x 112, Clips=10, Backbone=ResNet-34, label=ours2020.06 | 74.8 | |
| I3DPretrain=Kinetics, Backbone=Inception V22022.02 | 74.8 | |
| (no EPN)Pooling Order=TO+2021.10 | 74.8 | |
| MF-NetInput=16 x 3 x 224 x 224, Clips=502020.06 | 74.6 | |
| R(2+1)D-RGBInput=32 x 3 x 112 x 112, Clips=102020.06 | 74.5 | |
| R(2+1)DPretrain=Kinetics, Backbone=ResNet342022.02 | 74.5 | |
| I3D RGBBackbone=3D Inception-v1, Flow=false, Pre-train Data=ImageNet+Kinetics2019.08 | 74.3 | |
| DSPBackbone=TS ResNet + IDT2018.07 | 74.3 | |
| TSMBackbone=ResNet50, Pre-train=Kinetics, #Frames=82021.03 | 73.5 | |
| Ours-cumulativeBackbone=TSM-ResNet50, Pre-train=Kinetics, #Frames=all, #Clusters=82021.03 | 73.4 | |
| Ours-slopeBackbone=TSM-ResNet50, Pre-train=Kinetics, #Frames=all, #Clusters=82021.03 | 73.3 | |
| TEAPretrain=Kinetics, Backbone=ResNet502022.02 | 73.3 | |
| TSMPretrain=Kinetics, Backbone=ResNet502022.02 | 73.2 | |
| TSN+TSMAttention=with2018.09 | 72.7 | |
| ECOBackbone=BNInception+3D ResNet-18, Flow=false, Pre-train Data=Kinetics2019.08 | 72.4 | |
| DSPBackbone=TS ResNet2018.07 | 72.4 | |
| TSN+TSMAttention=without2018.09 | 72.2 | |
| STMBackbone=ResNet-50, Flow=false, Pre-train Data=ImageNet+Kinetics2019.08 | 72.2 | |
| STM Network+IDT2018.07 | 72.2 | |
| STMBackbone=ResNet50, Pre-train=ImageNet+Kinetics, #Frames=162021.03 | 72.2 | |
| STMPretrain=Kinetics, Backbone=ResNet502022.02 | 72.2 | |
| ShuttleNet+MIFS2018.07 | 71.7 | |
| SI+DI+OF+DOFBackbone=ResNeXt50, Pre-train=Imagenet, #Frames=dynamic images2021.03 | 71.5 | |
| TLE:Bilinear2018.09 | 71.1 | |
| SVMP2018.07 | 71 | |
| ARTNet with TSNPre-train dataset=Kinetics, Spatial resolution=112 x 112, Backbone architecture=ResNet-182017.11 | 70.9 | |
| ARTNet with TSNBackbone=3D ResNet-18, Flow=false, Pre-train Data=Kinetics2019.08 | 70.9 | |
| GRP2018.07 | 70.9 | |
| ARTNet with TSNInput=24 x 3 x 112 x 112, Clips=25, Backbone=ResNet-182020.06 | 70.9 | |
| ARTNetPretrain=Kinetics, Backbone=ResNet182022.02 | 70.9 | |
| TSMBackbone=ResNet-50, Flow=false, Pre-train Data=ImageNet+Kinetics2019.08 | 70.7 | |
| ST-ResNet+IDT2018.07 | 70.3 | |
| ResNeXt-101Dim=3D, Input=64f2017.11 | 70.2 | |
| ActionVLAD+iDTBackbone=VGG162018.09 | 69.8 | |
| TSNDim=2D2017.11 | 69.4 | |
| Temporal Seg. n/w2018.07 | 69.4 | |
| TSNPretrain=ImageNet2020.03 | 69.4 | |
| Fusion+iDT2018.09 | 69.2 | |
| Two-stream+IDT2018.11 | 69.2 | |
| ST Multiplier NetDim=2D2017.11 | 68.9 | |
| Spatiotemporal Multiplier Nets2018.09 | 68.9 | |
| Spatiotemporal Pyramid Net2018.09 | 68.9 | |
| STM Network2018.07 | 68.9 | |
| TSNBackbone=BN-Inception2018.09 | 68.5 | |
| ARTNet w/o TSNPre-train dataset=Kinetics, Spatial resolution=112 x 112, Backbone architecture=ResNet-182017.11 | 67.6 | |
| STCBackbone=ResNet101, Flow=false, Pre-train Data=Kinetics2019.08 | 66.8 | |
| Spatiotemporal ResNets2018.09 | 66.4 | |
| ST-ResNet2018.07 | 66.4 | |
| L2STM2018.07 | 66.2 | |
| Two-Stream CNN Fusion2018.09 | 65.4 | |
| TSMBackbone=ResNet50, Pre-train=Kinetics, #Frames=1, Implementation=our impl.2021.03 | 65.1 | |
| TSNBackbone=ResNet50, Pre-train=Kinetics, #Frames=82021.03 | 64.7 | |
| Hierarchical Attention Nets2018.09 | 64.3 | |
| ResNeXt-101Dim=3D2017.11 | 63.8 | |
| Multi-Granular Nets2018.09 | 63.6 | |
| Key Volume Mining2018.09 | 63.3 | |
| TDDDim=2D2017.11 | 63.2 | |
| VideoLSTM+iDT(FV)2018.09 | 63 | |
| C3DPre-train dataset=Kinetics, Spatial resolution=112 x 112, Backbone architecture=ResNet-182017.11 | 62.1 | |
| AVTSPre-training Dataset=Audioset, Modality=Audio, Backbone=MC3, Frozen=false2019.12 | 61.6 | |
| R3D-RGB & DSNInput=8 x 3 x 112 x 112, Clips=3, M=32020.06 | 61.6 |