Action Recognition on HMDB51
92.13-Fold AccuracyOmniVec2
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| OmniVec2Modality=Video2025.07 | 92.1 | — | — | — | |
| OmniVecModality=Video2025.07 | 91.6 | — | — | — | |
| DEEP-HAL+W+G+ODF+SDFWeighting (W)=true, RBF maps (G)=true, Object Detection Features (ODF)=true, Saliency Detection Features (SDF)=true2020.01 | 87.56 | 88.37 | 86.8 | 87.52 | |
| DEEP-HAL+W+ODF+SDFWeighting (W)=true, Object Detection Features (ODF)=true, Saliency Detection Features (SDF)=true2020.01 | 87.04 | 87.78 | 86.27 | 87.06 | |
| DEEP-HAL+ODF+SDFObject Detection Features (ODF)=true, Saliency Detection Features (SDF)=true2020.01 | 85.2 | 86.14 | 83.66 | 85.81 | |
| DEEP-HAL+ODFObject Detection Features (ODF)=true2020.01 | 84.29 | 85.03 | 83.59 | 84.25 | |
| DEEP-HAL+SDFSaliency Detection Features (SDF)=true2020.01 | 83.88 | 84.64 | 83.2 | 83.82 | |
| DEEP-HAL+WWeighting (W)=true2020.01 | 83.26 | 83.94 | 82.5 | 83.34 | |
| HAF/BoW/FV exactMode=exact2020.01 | 82.5 | — | — | — | |
| HAF+BoW/FV halluc.2019.06 | 82.48 | 83.46 | 82.61 | 81.37 | |
| HAF/BoW/FV hal.Mode=hallucinated2020.01 | 82.48 | — | — | — | |
| EvaNet (Ensemble)2020.01 | 82.3 | — | — | — | |
| PA3D + I3D2020.01 | 82.1 | — | — | — | |
| ADL+I3D2019.06 | 81.5 | — | — | — | |
| ADL+I3D2020.01 | 81.5 | — | — | — | |
| Full-FT I3D2019.06 | 81.3 | — | — | — | |
| Full-FT I3DTraining=Full Fine-Tune2020.01 | 81.3 | — | — | — | |
| HAF only2019.06 | 81.02 | 81.83 | 80.78 | 80.45 | |
| Two-Stream I3DPre-training=Kinetics2017.05 | 80.9 | — | — | — | |
| Two-Stream I3DPre-training=ImageNet+Kinetics2017.05 | 80.7 | — | — | — | |
| Hidden Two-Stream NetworkBackbone=I3D2017.04 | 78.7 | — | — | — | |
| R(2+1)D Two-streamflow=true, #frame=32+32, Backbone FLOPs=304G, #clips=115, speed (V/s)=0.22020.07 | 78.7 | — | — | — | |
| MSNet-R50flow=false, #frame=16, Backbone FLOPs=67G, #clips=10, speed (V/s)=31.22020.07 | 77.4 | — | — | — | |
| Flow-I3DPre-training=Kinetics2017.05 | 77.3 | — | — | — | |
| Flow-I3DPre-training=ImageNet+Kinetics2017.05 | 77.1 | — | — | — | |
| Rep-flow (R(2+1)D)flow=false, #frame=32, Backbone FLOPs=152G, #clips=25, speed (V/s)=2.02020.07 | 77.1 | — | — | — | |
| Rep-flow (ResNet-50)flow=false, #frame=32, Backbone FLOPs=132G, #clips=25, speed (V/s)=3.72020.07 | 76.4 | — | — | — | |
| MSNet-R50flow=false, #frame=8, Backbone FLOPs=34G, #clips=10, speed (V/s)=54.22020.07 | 75.8 | — | — | — | |
| RGB-I3DPre-training=ImageNet+Kinetics2017.05 | 74.8 | — | — | — | |
| RGB-I3DPre-training=Kinetics2017.05 | 74.3 | — | — | — | |
| ADL+ResNet+IDT2019.06 | 74.3 | — | — | — | |
| R(2+1)Dflow=false, #frame=32, Backbone FLOPs=152G, #clips=115, speed (V/s)=8.72020.07 | 74.3 | — | — | — | |
| OFF(RGB+Flow+RGB Diff)flow=true, #frame=1+5+5, Backbone FLOPs=N/A, #clips=252020.07 | 74.2 | — | — | — | |
| TVNet-50 + IDTwith IDT=true2018.04 | 72.6 | — | — | — | |
| STM Network+IDT2019.06 | 72.2 | — | — | — | |
| STMflow=false, #frame=16, Backbone FLOPs=67G, #clips=302020.07 | 72.2 | — | — | — | |
| TSM (reproduced)flow=false, #frame=8, Backbone FLOPs=33G, #clips=10, speed (V/s)=64.12020.07 | 71.9 | — | — | — | |
| TVNet-502018.04 | 71 | — | — | — | |
| TVNetflow=false, #frame=18, Backbone FLOPs=N/A, #clips=2502020.07 | 71 | — | — | — | |
| DT+Hybrid architecturesStrategy=Hybrid2017.04 | 70.4 | — | — | — | |
| ST-ResNet+iDTBackbone Architecture=ResNet, Strategy=iDT2017.04 | 70.3 | — | — | — | |
| ST-ResNet + IDTPre-training=None2017.05 | 70.3 | — | — | — | |
| ST-ResNet + IDTwith IDT=true2018.04 | 70.3 | — | — | — | |
| CoViAR + flowInput Streams=Compressed Representation + Optical Flow2017.12 | 70.2 | — | — | — | |
| ActionVLAD (VGG-16) + iDTBackbone Architecture=VGG-16, Strategy=iDT2017.04 | 69.8 | — | — | — | |
| TSNinput_modalities=3 modalities (RGB+Flow+Warped Flow)2016.08 | 69.4 | — | — | — | |
| TSNBackbone Architecture=BN-Inception, Modalities Used=3-modality2017.04 | 69.4 | — | — | — | |
| Temporal Segment NetworksPre-training=None2017.05 | 69.4 | — | — | — | |
| Two-stream fusion architecture (VGG-16, VGG-16) + IDTSpatial (S) network=VGG-16, Temporal (T) network=VGG-16, Hand-crafted features (IDT)=true2016.04 | 69.2 | — | — | — | |
| Two-Stream Fusion+iDTStrategy=iDT2017.04 | 69.2 | — | — | — | |
| Two-str. (conv. fusion)+IDTModality=RGB + Flow + IDT2016.04 | 69.2 | — | — | — | |
| Two-Stream Fusion + IDTPre-training=None2017.05 | 69.2 | — | — | — | |
| TS-LSTM2017.03 | 69 | — | — | — | |
| TSNinput_modalities=2 modalities (RGB+Flow)2016.08 | 68.5 | — | — | — | |
| TSNModalities=22017.03 | 68.5 | — | — | — | |
| TSN2018.04 | 68.5 | — | — | — | |
| Temporal-Inception2017.03 | 67.5 | — | — | — | |
| Two-stream fusion architecture (VGG-16, VGG-M) + IDTSpatial (S) network=VGG-16, Temporal (T) network=VGG-M, Hand-crafted features (IDT)=true2016.04 | 67.3 | — | — | — | |
| Key volume2017.03 | 67.2 | — | — | — | |
| LTC+iDTStrategy=iDT2017.04 | 67.2 | — | — | — | |
| LTC Flow+RGB+IDTModality=RGB + Flow + IDT2016.04 | 67.2 | — | — | — | |
| ActionVLAD (LateFuse, VGG-16)Backbone Architecture=VGG-16, Fusion=LateFuse2017.04 | 66.9 | — | — | — | |
| IDT with stacked Fisher encodingEncoding=Stacked Fisher2014.06 | 66.8 | — | — | — | |
| iDT & Stacked FVCombined with iDT & FV=true2016.04 | 66.8 | — | — | — | |
| Hidden Two-Stream NetworkBackbone=TSN2017.04 | 66.8 | — | — | — | |
| ResNet-50 Two-streamflow=true, #frame=32+32, Backbone FLOPs=264G, #clips=25, speed (V/s)=0.22020.07 | 66.6 | — | — | — | |
| ST-ResNet2018.04 | 66.4 | — | — | — | |
| TDD + CPD2016.04 | 66.2 | — | — | — | |
| TDD & FVCombined with iDT & FV=true2016.04 | 65.9 | — | — | — | |
| TDD+IDTHand-crafted features (IDT)=true2016.04 | 65.9 | — | — | — | |
| TDD + iDTfusion=early fusion2015.05 | 65.9 | — | — | — | |
| TDD+IDTModality=RGB + Flow + IDT2016.04 | 65.9 | — | — | — | |
| TDD + IDTPre-training=None2017.05 | 65.9 | — | — | — | |
| TDD2018.04 | 65.9 | — | — | — | |
| MPR2016.08 | 65.5 | — | — | — | |
| Spatiotemporal fusion ConvNetSpatial stream backbone=VGG-16, Temporal stream backbone=VGG-16, Fusion strategy=3D Conv + 3D Pooling2016.04 | 65.4 | — | — | — | |
| Convolutional Two-stream2017.03 | 65.4 | — | — | — | |
| Two-Stream FusionBackbone Architecture=VGG-162017.04 | 65.4 | — | — | — | |
| Two-stream (conv. fusion)Modality=RGB + Flow2016.04 | 65.4 | — | — | — | |
| Two-Stream Fusion2018.04 | 65.4 | — | — | — | |
| CPD2016.04 | 65.2 | — | — | — | |
| Dynamic Image Networks + IDTPre-training=None2017.05 | 65.2 | — | — | — | |
| MIFS2016.04 | 65.1 | — | — | — | |
| IDT+MIFSModality=IDT2016.04 | 65.1 | — | — | — | |
| LTC2016.08 | 64.8 | — | — | — | |
| LTCBackbone Architecture=Long-term Temporal Conv2017.04 | 64.8 | — | — | — | |
| LTC Flow+RGBModality=RGB + Flow2016.04 | 64.8 | — | — | — | |
| Spatiotemporal fusion ConvNetSpatial stream backbone=VGG-16, Temporal stream backbone=VGG-16, Fusion strategy=Single tower after fusion (3D Conv + 3D Pooling)2016.04 | 64.6 | — | — | — | |
| RGB DiffFramework=TSN2017.04 | 64.5 | — | — | — | |
| Video darwin2016.04 | 63.7 | — | — | — | |
| VideoDarwin2016.08 | 63.7 | — | — | — | |
| VideoDarwin2017.04 | 63.7 | — | — | — | |
| Transformation2017.03 | 63.4 | — | — | — | |
| KVMF2016.08 | 63.3 | — | — | — | |
| KVMF2017.04 | 63.3 | — | — | — | |
| KVMF2018.04 | 63.3 | — | — | — | |
| TDD & FV2016.04 | 63.2 | — | — | — | |
| TDD+FV2016.08 | 63.2 | — | — | — | |
| TDD+FVencoding=Fisher Vector2015.05 | 63.2 | — | — | — | |
| TDD+FVStrategy=Trajectory-aligned descriptor2017.04 | 63.2 | — | — | — |