Action Classification on HMDB51 (split1)
75AccuracyMMV
Evaluation Results
| Method | Links | |
|---|---|---|
| MMVEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS+HT (16y), Modality=VAT2020.08 | 75 | |
| Kinetics pretrained I3DModel Type=Multi-frame, Pre-training=Kinetics, Fine-tuned from=UCF1012016.12 | 74.8 | |
| GDTEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=IG65M (21y), Modality=VA2020.08 | 72.8 | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-152(2x)2020.08 | 69.9 | |
| MMV-VAEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS+HT (16y), Modality=VA2020.08 | 68.3 | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-502020.08 | 68 | |
| XDCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=IG65M (21y), Modality=VA2020.08 | 67.4 | |
| EloEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=YT8M (13y), Modality=VFA2020.08 | 67.4 | |
| MMVEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=AS+HT (16y), Modality=VAT2020.08 | 67.1 | |
| CVRLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V, Backbone=R3D-502020.08 | 66.7 | |
| GDTEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 66.1 | |
| EloEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=YT8M (13y), Modality=VFA2020.08 | 64.5 | |
| CoCLREvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=VF2020.08 | 62.9 | |
| COCLR†Input Size=32 x 128x128, Arch=S3D-23, Modality=RGB + Optical Flow2022.06 | 62.9 | |
| AVTSEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 61.6 | |
| MMV-VAEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=AS+HT (16y), Modality=VA2020.08 | 61.5 | |
| MIL-NCEEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=HT (15y), Modality=VT2020.08 | 61 | |
| XDCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 61 | |
| DynamoNetEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=YT8M (13y), Modality=V2020.08 | 59.9 | |
| CVRLEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K600 (44d), Modality=V, Backbone=R3D-502020.08 | 59.7 | |
| CVRLEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K400 (28d), Modality=V, Backbone=R3D-502020.08 | 57.3 | |
| SLIC†Input Size=32 x 128x128, Arch=R3D-18, Modality=RGB + Optical Flow, Pretraining Frames=162022.06 | 57.3 | |
| ActionFlowNet (UCF101)Model Type=Multi-frame, Pre-training=FlowNet part pretrained on UCF101, Fine-tuned from=UCF1012016.12 | 56.4 | |
| XDCEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=AS (240d), Modality=VA2020.08 | 56 | |
| MIL-NCEEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=HT (15y), Modality=VT2020.08 | 54.8 | |
| COCLR-RGBInput Size=32 x 128x128, Arch=S3D-23, Modality=RGB2022.06 | 54.6 | |
| TSN, BN-inception (RGB)Backbone=BN-inception, Stream=RGB2017.11 | 54.4 | |
| Pose regularized Attentional PoolingStream=RGB, Input Resolution=480px2017.11 | 54.4 | |
| Sports-1M pretrained C3DModel Type=Multi-frame, Pre-training=Sports-1M, Fine-tuned from=UCF1012016.12 | 53.5 | |
| CoCLREvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K400 (28d), Modality=VF2020.08 | 52.4 | |
| SLICInput Size=32 x 128x128, Arch=R3D-18, Modality=RGB, Pretraining Frames=162022.06 | 52.2 | |
| CoCon-E*†Input Size=224x224, Arch=R3D-18, Modality=RGB + Optical Flow2022.06 | 52 | |
| ActionVLADStream=RGB2017.11 | 51.2 | |
| Linear Attentional PoolingStream=RGB, Input Resolution=480px2017.11 | 51.1 | |
| Multi-frame FlowNet fine-tuneModel Type=Multi-frame, Initialization=Pretrained on UCF101 for optical flow, Fine-tuned from=UCF1012016.12 | 50.6 | |
| SpeedNetEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 48.8 | |
| TSN, ResNet101 (RGB)Backbone=ResNet101, Stream=RGB, Input Resolution=480px2017.11 | 48.2 | |
| ImageNet pretrained ResNet-18Model Type=Two-frame, Initialization=ImageNet, Fine-tuned from=UCF1012016.12 | 47.1 | |
| CoCon-RGB*Input Size=224x224, Arch=R3D-18, Modality=RGB2022.06 | 46 | |
| CBTEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K600+ (273d), Modality=V2020.08 | 44.6 | |
| ActionFlowNet-2F (FlCh+UCF101)Model Type=Two-frame, Pre-training=FlowNet part pretrained on FlyingChairs and UCF101, Fine-tuned from=UCF1012016.12 | 42.6 | |
| StackedModel Type=Two-frame, Initialization=FlowNet pretrained on UCF101, Fine-tuned from=UCF1012016.12 | 42.4 | |
| ActionFlowNet-2F (UCF101)Model Type=Two-frame, Pre-training=FlowNet part pretrained on UCF101, Fine-tuned from=UCF1012016.12 | 42.4 | |
| Stack-of-Diff.Weights=ImageNet supervised2016.11 | 40.8 | |
| PacePredEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 36.6 | |
| DPCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 35.7 | |
| 3D-RotNetEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 34.3 | |
| ST-PuzzleEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 33.7 | |
| MotionPredEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 33.4 | |
| O3NEncoder=Stack-of-Diff.2016.11 | 32.5 | |
| ClipOrderEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 30.9 | |
| FlowNet fine-tuneModel Type=Two-frame, Initialization=Pretrained on UCF101 for optical flow, Fine-tuned from=UCF1012016.12 | 29.1 | |
| Stack-of-Diff.Weights=Random2016.11 | 28.3 | |
| ScratchModel Type=Two-frame, Backbone=ResNet-18, Initialization=Random, Fine-tuned from=UCF1012016.12 | 23.9 | |
| Seq. Ver.2016.11 | 19.8 | |
| DrLim2016.11 | 16.3 | |
| TempCoh2016.11 | 15.9 | |
| Obj. Patch2016.11 | 15.6 |