Action Classification on HMDB51 (over all three splits)
75.9AccuracyS3D-G
Evaluation Results
| Method | Links | |
|---|---|---|
| S3D-GInputs=RGB, Pre-train=ImNet+Kinetics2017.12 | 75.9 | |
| I3DInputs=RGB, Pre-train=ImNet+Kinetics2017.12 | 74.8 | |
| R(2+1)DInputs=RGB, Pre-train=Kinetics2017.12 | 74.5 | |
| GDTH/W x T=112 x 32, Backbone=R(2+1)D, Modality=V+A, Pretraining=IG65M, Evaluation Protocol=finetune2021.01 | 72.8 | |
| ARTNet w/ TSNInputs=RGB, Pre-train=Kinetics2017.12 | 70.9 | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-152(2x)2020.08 | 70.6 | |
| Chained Multi-stream Networksmode=chained2017.04 | 69.7 | |
| TSN2017.04 | 69.4 | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-502020.08 | 69.4 | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V, Backbone=R3D-502020.08 | 67.9 | |
| CVRLBackbone=R3D-50, Input Size=32 x 224, Pre-training Dataset=Kinetics-4002021.01 | 66.7 | |
| CPD2017.04 | 66.2 | |
| TS Fusion2017.04 | 65.4 | |
| LTC2017.04 | 64.8 | |
| RSPNetBackbone=S3D-G, Input Size=64 x 224, Pre-training Dataset=Kinetics-4002021.01 | 64.7 | |
| Multi-Granular2017.04 | 63.6 | |
| KVMF2017.04 | 63.3 | |
| COCLRBackbone=S3D-23, Input Size=16 x 112, Pre-training Dataset=Kinetics-400, Optical Flow utilization=true2021.01 | 62.9 | |
| AVTSH/W x T=224 x 25, Backbone=MC3, Modality=V+A, Pretraining=AudioSet, Evaluation Protocol=finetune2021.01 | 61.6 | |
| MIL-NCEH/W x T=224 x -, Backbone=S3D, Modality=V+T, Pretraining=HowTo100M, Evaluation Protocol=finetune2021.01 | 61 | |
| TCLRBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 60 | |
| GDTH/W x T=112 x 32, Backbone=R(2+1)D, Modality=V+A, Pretraining=K400, Evaluation Protocol=finetune2021.01 | 60 | |
| CVRLEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-502020.08 | 59.7 | |
| Two-stream2017.04 | 59.4 | |
| COCLRBackbone=S3D-23, Input Size=16 x 112, Pre-training Dataset=UCF101, Optical Flow utilization=true2021.01 | 58.7 | |
| CVRLEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K400 (28d), Modality=V, Backbone=R3D-502020.08 | 58.3 | |
| SeCOBackbone=R50+TSN, Input Size=50 x 224, Pre-training Dataset=ImageNet+Kinetics2021.01 | 55.6 | |
| TCLR (Best Ablation)Backbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 55.4 | |
| M-fusion2017.04 | 54.9 | |
| Res3DInputs=RGB, Pre-train=Sports-1M2017.12 | 54.9 | |
| TCLRH/W x T=112 x 16, Backbone=R(2+1)D, Modality=V, Params (x 10^6)=14.4, Pretraining=K400, Evaluation Protocol=finetune2021.01 | 54.2 | |
| TCLRBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 53.6 | |
| TCLRBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 53.6 | |
| TCLRH/W x T=112 x 16, Backbone=R3D-18, Modality=V, Params (x 10^6)=13.5, Pretraining=K400, Evaluation Protocol=finetune2021.01 | 53.6 | |
| TCLRH/W x T=112 x 16, Backbone=R(2+1)D, Modality=V, Params (x 10^6)=14.4, Pretraining=UCF101, Evaluation Protocol=finetune2021.01 | 53.6 | |
| TCLR (Best Ablation)Backbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 53.5 | |
| AVTSH/W x T=224 x 25, Backbone=I3D, Modality=V+A, Pretraining=K400, Evaluation Protocol=finetune2021.01 | 53 | |
| TCLRBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 52.9 | |
| TCLRH/W x T=112 x 16, Backbone=R3D-18, Modality=V, Params (x 10^6)=13.5, Pretraining=UCF101, Evaluation Protocol=finetune2021.01 | 52.9 | |
| Pose regularized Attentional PoolingStream=RGB, Input Resolution=480px2017.11 | 52.2 | |
| C3DInputs=RGB, Pre-train=Sports-1M2017.12 | 51.6 | |
| TSN, BN-inception (RGB)Backbone=BN-inception, Stream=RGB2017.11 | 51 | |
| Linear Attentional PoolingStream=RGB, Input Resolution=480px2017.11 | 50.8 | |
| ActionVLADStream=RGB2017.11 | 49.8 | |
| Temp TransBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-6002021.01 | 49.8 | |
| SSTLBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 49.7 | |
| VideoMoCoBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 49.2 | |
| VideoDIMBackbone=R(2+1)D-18, Input Size=32 x 128, Pre-training Dataset=Kinetics-6002021.01 | 49.2 | |
| RGB Stream, ResNet50 (RGB)Backbone=ResNet50, Stream=RGB2017.11 | 48.9 | |
| SpeedNetBackbone=S3D-G, Input Size=16 x 224, Pre-training Dataset=Kinetics-4002021.01 | 48.8 | |
| VTHCLBackbone=R3D-18, Input Size=8 x 224, Pre-training Dataset=Kinetics-4002021.01 | 48.6 | |
| TCLRBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 48.6 | |
| TCLRH/W x T=112 x 16, Backbone=C3D, Modality=V, Params (x 10^6)=27.7, Pretraining=UCF101, Evaluation Protocol=finetune2021.01 | 48.6 | |
| MFOBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 47.6 | |
| Temp TransBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 47.5 | |
| TSN, ResNet101 (RGB)Backbone=ResNet101, Stream=RGB, Input Resolution=480px2017.11 | 47.1 | |
| XDCH/W x T=224 x 32, Backbone=R(2+1)D, Modality=V+A, Pretraining=K400, Evaluation Protocol=finetune2021.01 | 47.1 | |
| RGB Stream, ResNet152 (RGB)Backbone=ResNet152, Stream=RGB2017.11 | 46.7 | |
| CSJBackbone=R3D-18, Input Size=16 x 224, Pre-training Dataset=Kinetics-4002021.01 | 46.7 | |
| Temp TransBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 46.4 | |
| TaCoBackbone=R(2+1)D-18, Input Size=16 x 224, Pre-training Dataset=Kinetics-4002021.01 | 46 | |
| TaCoBackbone=R3D-18, Input Size=16 x 224, Pre-training Dataset=Kinetics-4002021.01 | 45.4 | |
| BFPBackbone=R3D-18, Input Size=40 x 128, Pre-training Dataset=Kinetics-4002021.01 | 45.3 | |
| VIEBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 44.8 | |
| CVRL (Reproduced)Backbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 44.6 | |
| RSPNetBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 44.6 | |
| CBTH/W x T=112 x 16, Backbone=S3D, Modality=V, Params (x 10^6)=20.0, Pretraining=K600, Evaluation Protocol=finetune2021.01 | 44.6 | |
| VideoMoCoBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 43.6 | |
| RSPNetBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 41.8 | |
| UnsupIDTBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 41.6 | |
| TCPBackbone=R3D-18, Input Size=× 224, Pre-training Dataset=Kinetics-4002021.01 | 41.1 | |
| STSBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 40.5 | |
| DSMBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 40.5 | |
| Temp TransBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=Kinetics-6002021.01 | 39.6 | |
| Temp TransBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 38.4 | |
| STSBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 37.8 | |
| Pace PredBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 36.6 | |
| TCEH/W x T=224 x -, Backbone=R2D50, Modality=V, Params (x 10^6)=23.0, Pretraining=K400, Evaluation Protocol=finetune2021.01 | 36.6 | |
| CSJBackbone=R3D-18, Input Size=16 x 224, Pre-training Dataset=UCF1012021.01 | 36 | |
| Pace PredBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 35.9 | |
| ImagenetBackbone=VGG-M-20482017.08 | 35.3 | |
| PRPBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 35 | |
| TCPBackbone=R3D-18, Input Size=× 224, Pre-training Dataset=UCF1012021.01 | 34.7 | |
| DPCBackbone=R3D-18, Input Size=40 x 128, Pre-training Dataset=Kinetics-4002021.01 | 34.5 | |
| PRPBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 34.5 | |
| STSBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 34.4 | |
| Var. PSPBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 34.3 | |
| STSBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 34.2 | |
| STSBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 34.1 | |
| ST-PuzzleBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 33.7 | |
| Var. PSPBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 33.7 | |
| MA Stats-1Backbone=C3D, Input Size=16 x 112, Pre-training Dataset=Kinetics-4002021.01 | 33.4 | |
| STSBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 32.7 | |
| MA Stats-1Backbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 32.6 | |
| VCPBackbone=C3D, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 32.5 | |
| O3NH/W x T=227 x -, Backbone=AlexNet, Modality=V, Params (x 10^6)=61.0, Pretraining=UCF101, Evaluation Protocol=finetune2021.01 | 32.5 | |
| VCPBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 32.2 | |
| VCPBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 31.5 | |
| VCOPBackbone=R(2+1)D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 30.9 | |
| PRPBackbone=R3D-18, Input Size=16 x 112, Pre-training Dataset=UCF1012021.01 | 29.7 |