Action Classification on HMDB51
74.5Top-1 AccuracyCross-Ent.
Evaluation Results
| Method | Links | |
|---|---|---|
| Cross-Ent.Evaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=16 x 112^2, Arch=R(2+1)D-342022.06 | 74.5 | |
| COCLREvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=32 x 128^2, Arch=S3D-232022.06 | 62.9 | |
| COCLREvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=S3D-232022.06 | 58.7 | |
| TANSettings=finetuned with TAN, Backbone=S3D, Evaluation Protocol=Linear Probing2022.04 | 56.7 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=S3D-232022.06 | 56.2 | |
| Supervised SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=R3D-182022.06 | 56.1 | |
| SeCoEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 55.6 | |
| MIL-NCESettings=reproduce of [47], Backbone=S3D, Evaluation Protocol=Linear Probing2022.04 | 55.2 | |
| COCLR-RGBEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=32 x 128^2, Arch=S3D-232022.06 | 54.6 | |
| MemDPCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=VF2020.08 | 54.5 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=R3D-182022.06 | 54.5 | |
| TCLREvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=16x2 x 112^2, Arch=R3D-18, Split Setting=3-split avg2022.06 | 53.6 | |
| MIL-NCESettings=reported by [47], Backbone=S3D, Evaluation Protocol=Linear Probing2022.04 | 53.1 | |
| TCLREvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=16x2 x 112^2, Arch=R3D-18, Split Setting=3-split avg2022.06 | 52.9 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=32 x 128^2, Arch=R3D-18, Split Setting=Split-12022.06 | 52.2 | |
| COCLR-RGBEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=S3D-232022.06 | 52.1 | |
| CoCon-EEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=(-) x 224^2, Arch=R3D-18, Input Modality=Optical Flow / Residual, Split Setting=3-split avg2022.06 | 52 | |
| CoCon-EEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=(-) x 224^2, Arch=R3D-18, Input Modality=Optical Flow / Residual, Split Setting=3-split avg2022.06 | 52 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=32 x 128^2, Arch=R3D-18, Split Setting=3-split avg2022.06 | 52 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=32 x 128^2, Arch=S3D-23, Split Setting=3-split avg2022.06 | 51.7 | |
| Supervised SLICEvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=R3D-182022.06 | 50.6 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=32 x 128^2, Arch=S3D-23, Split Setting=Split-12022.06 | 49.4 | |
| VTHCLEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 49.2 | |
| SpeedNetEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=16 x 224^2, Arch=S3D-G2022.06 | 48.8 | |
| SLICEvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=R3D-182022.06 | 48.3 | |
| Supervised SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=16 x 128^2, Arch=R3D-182022.06 | 46.6 | |
| SLICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=16 x 128^2, Arch=R3D-182022.06 | 46.2 | |
| CoCon-RGBEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=(-) x 224^2, Arch=R3D-18, Split Setting=3-split avg2022.06 | 46 | |
| Supervised SLICEvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=16 x 128^2, Arch=R3D-182022.06 | 44.9 | |
| SLICEvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=S3D-232022.06 | 44.7 | |
| VideoMoCoEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=16 x 112^2, Arch=R3D-182022.06 | 43.6 | |
| SLICEvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=16 x 128^2, Arch=R3D-182022.06 | 41.8 | |
| RSPNetEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=16 x 112^2, Arch=R3D-182022.06 | 41.8 | |
| MemDPCEvaluation Protocol=Fine-Tuning, Pre-train data (duration)=K400 (28d), Modality=V2020.08 | 41.2 | |
| ImageNet PretrainedArchitecture=VGG-M-2048, Number of Parameters=25.4M, Pre-training Dataset=ImageNet2019.09 | 40.5 | |
| CoCLREvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=S3D-232022.06 | 40.2 | |
| CoCLR-RGBEvaluation Protocol=Linear Probe, Pre-train Dataset=UCF101, Input Size=32 x 128^2, Arch=S3D-232022.06 | 39.1 | |
| CoCon-RGBEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=(-) x 224^2, Arch=R3D-182022.06 | 38.4 | |
| IICEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=16 x 112^2, Arch=R3D-18, Input Modality=Optical Flow / Residual, Split Setting=3-split avg2022.06 | 38.3 | |
| DPC (Ours)Architecture=3D-ResNet34, Number of Parameters=32.6M, Pre-training Dataset=Kinetics-400, Input Resolution=224x2242019.09 | 35.7 | |
| DPC (Ours)Architecture=3D-ResNet18, Number of Parameters=14.2M, Pre-training Dataset=Kinetics-400, Input Resolution=128x1282019.09 | 34.5 | |
| DPCEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=Kinetics400, Input Size=40 x 128^2, Arch=R3D-182022.06 | 34.5 | |
| 3D-RotNetArchitecture=3D-ResNet18-full, Number of Parameters=33.6M, Pre-training Dataset=Kinetics-400, Input Resolution=112x1122019.09 | 33.7 | |
| 3D-ST PuzzleArchitecture=3D-ResNet18-full, Number of Parameters=33.6M, Pre-training Dataset=Kinetics-400, Input Resolution=224x224, Multi-task Learning=Rotation + 3D Puzzle2019.09 | 33.7 | |
| VCPEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=16 x 112^2, Arch=R3D-18, Split Setting=3-split avg2022.06 | 31.5 | |
| MemDPCEvaluation Protocol=Linear Evaluation, Pre-train data (duration)=K400 (28d), Modality=VF2020.08 | 30.5 | |
| VCOPEvaluation Protocol=End-to-end Finetuning, Pre-train Dataset=UCF101, Input Size=16 x 112^2, Arch=R3D-18, Split Setting=3-split avg2022.06 | 29.5 | |
| OPNArchitecture=VGG-M-2048, Number of Parameters=8.6M, Pre-training Dataset=UCF101/HMDB51, Input Resolution=80x802019.09 | 23.8 | |
| None (Rand. Init.)Input Size=16 x 128^2, Arch=R3D-182022.06 | 22.3 | |
| Shuffle & LearnArchitecture=CaffeNet, Number of Parameters=58.3M, Pre-training Dataset=UCF101/HMDB51, Input Resolution=227x2272019.09 | 18.1 | |
| Random InitializationArchitecture=3D-ResNet18, Number of Parameters=14.2M, Pre-training Dataset=None2019.09 | 17.1 |