Action Recognition on HMDB51 1 (test)
68.2Top-1 AccuracyProViCo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProViCoType=(ii), Backbone=R3D-50 (31.7M), Input size=224 × 224, Batch size=512, Pretrain data=UCF101, Finetune=true2022.04 | 68.2 | — | |
| CORPType=(iii), Backbone=R3D-50 (31.7M), Input size=224 × 224, Batch size=512, Pretrain data=UCF/HMDB, Finetune=true2022.04 | 68 | — | |
| CVRLType=(ii), Backbone=R3D-50 (31.7M), Input size=224 × 224, Batch size=1024, Pretrain data=K400, Finetune=true2022.04 | 66.7 | — | |
| GDTBackbone=R(2+1)D-18, Finetune Input Size=30 x 112^2, Advanced hierarchical sampling=true2022.01 | 62.3 | — | |
| CATEType=(ii), Backbone=R3D-50 (31.7M), Input size=128 × 128, Batch size=1024, Pretrain data=K400, Finetune=true2022.04 | 61.9 | — | |
| RINCEBackbone=R(2+1)D-18, Finetune Input Size=32 x 224^22022.01 | 61.6 | — | |
| AVID+CMABackbone=R(2+1)D-18, Finetune Input Size=32 x 224^22022.01 | 60.8 | — | |
| Cross-AVIDBackbone=R(2+1)D-18, Finetune Input Size=32 x 224^22022.01 | 59.9 | — | |
| TECType=(iii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=192, Pretrain data=K400, Finetune=true2022.04 | 59.8 | — | |
| ProViCoType=(ii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=96, Pretrain data=K400, Finetune=true2022.04 | 59.4 | — | |
| MCNType=(ii), Backbone=R3D-18 (20.2M), Input size=128 × 128, Batch size=80, Pretrain data=K400, Finetune=true, Notes=Additional residual views used2022.04 | 59.3 | — | |
| CORPType=(iii), Backbone=R3D-50 (31.7M), Input size=224 × 224, Batch size=512, Pretrain data=K400, Finetune=false2022.04 | 58.7 | — | |
| ProViCoType=(ii), Backbone=R3D-18 (20.2M), Input size=112 × 112, Batch size=96, Pretrain data=K400, Finetune=true2022.04 | 58.4 | — | |
| ProViCoType=(ii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=96, Pretrain data=UCF101, Finetune=true2022.04 | 58 | — | |
| InfoNCEBackbone=R(2+1)D-18, Finetune Input Size=32 x 224^22022.01 | 57.8 | — | |
| ProViCoType=(ii), Backbone=R3D-18 (20.2M), Input size=112 × 112, Batch size=96, Pretrain data=UCF101, Finetune=true2022.04 | 57.1 | — | |
| AVTSBackbone=MC3-18, Finetune Input Size=25 x 224^22022.01 | 56.9 | — | |
| TECType=(iii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=192, Pretrain data=UCF101, Finetune=true2022.04 | 56.9 | — | |
| Robust-xIDBackbone=R(2+1)D-18, Finetune Input Size=32 x 224^22022.01 | 55 | — | |
| MCNType=(ii), Backbone=R3D-18 (20.2M), Input size=128 × 128, Batch size=80, Pretrain data=UCF/HMDB, Finetune=true2022.04 | 54.8 | — | |
| TCLRType=(i), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=40, Pretrain data=K400, Finetune=true2022.04 | 54.2 | — | |
| CATEType=(ii), Backbone=R3D-50 (31.7M), Input size=224 × 224, Batch size=1024, Pretrain data=K400, Finetune=false2022.04 | 53.6 | — | |
| TCLRType=(ii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=40, Pretrain data=UCF101, Finetune=true2022.04 | 53.6 | — | |
| ProViCoType=(ii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=96, Pretrain data=K400, Finetune=false2022.04 | 53.5 | — | |
| XDCBackbone=R(2+1)D-18, Finetune Input Size=32 x 224^22022.01 | 52.6 | — | |
| DSMType=(i), Backbone=I3D (25.0M), Input size=224 × 224, Batch size=128, Pretrain data=K400, Finetune=true2022.04 | 52.5 | — | |
| ProViCoType=(ii), Backbone=R3D-18 (20.2M), Input size=112 × 112, Batch size=96, Pretrain data=K400, Finetune=false2022.04 | 52.2 | — | |
| VideoMoCoType=(ii), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=128, Pretrain data=K400, Finetune=true2022.04 | 49.2 | — | |
| MFOType=(ii), Backbone=R3D-18 (20.2M), Input size=112 × 112, Batch size=256, Pretrain data=K400, Finetune=true2022.04 | 47.6 | — | |
| SeLaViBackbone=R(2+1)D-18, Finetune Input Size=32 x 112^22022.01 | 47.1 | — | |
| RTTType=(i), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Batch size=256, Pretrain data=UCF101, Finetune=true2022.04 | 46.4 | — | |
| CBTBackbone=S3D, Finetune Input Size=16 x 112^22022.01 | 44.6 | — | |
| MFOType=(ii), Backbone=R3D-18 (20.2M), Input size=112 × 112, Batch size=256, Pretrain data=UCF101, Finetune=true2022.04 | 41.1 | — | |
| DSMType=(i), Backbone=C3D (34.8M), Input size=112 × 112, Batch size=128, Pretrain data=UCF101, Finetune=true2022.04 | 40.5 | — | |
| DPCBackbone=R3D-18, Finetune Input Size=25 x 128^22022.01 | 35.7 | — | |
| PRPType=(i), Backbone=R(2+1)D (15.4M), Input size=112 × 112, Pretrain data=UCF101, Finetune=true2022.04 | 35 | — | |
| 3D-RotNetBackbone=R3D-18, Finetune Input Size=16 x 112^22022.01 | 33.7 | — | |
| MFOType=(ii), Backbone=R3D-18 (20.2M), Input size=112 × 112, Batch size=256, Pretrain data=K400, Finetune=false2022.04 | 33.4 | — | |
| VCPType=(i), Backbone=C3D (34.8M), Input size=112 × 112, Pretrain data=UCF101, Finetune=true2022.04 | 32.5 | — | |
| ClipOrderBackbone=R3D-18, Finetune Input Size=16 x 112^22022.01 | 30.9 | — | |
| DrLimPre-training Dataset=UCF1012019.04 | — | 13.4 | |
| GeometryPre-training Dataset=UCF1012019.04 | — | 23.3 | |
| Motion and Appearance Statistics (MAS)Pre-training Dataset=UCF1012019.04 | — | 32.6 | |
| Motion and Appearance Statistics (MAS)Pre-training Dataset=Kinetics2019.04 | — | 33.4 | |
| Object PatchPre-training Dataset=UCF1012019.04 | — | 15.6 | |
| OPNPre-training Dataset=UCF1012019.04 | — | 22.1 | |
| Seq Ver.Pre-training Dataset=UCF1012019.04 | — | 19.8 | |
| ST-puzzlePre-training Dataset=Kinetics2019.04 | — | 28.3 | |
| TempCohPre-training Dataset=UCF1012019.04 | — | 15.9 |