Action Recognition on HMDB51 (split 1)
80.7Top-1 AccI3D Two-Stream
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| I3D Two-StreamFine-tuning=true2018.12 | 80.7 | — | — | — | — | — | |
| D3D + D3DEnsemble=true, Fine-tuning=true2018.12 | 80.5 | — | — | — | — | — | |
| D3DPre-training=Kinetics-600, Fine-tuning=true2018.12 | 79.3 | — | — | — | — | — | |
| Hidden Two-StreamFine-tuning=true2018.12 | 78.7 | — | — | — | — | — | |
| D3DPre-training=Kinetics-400, Fine-tuning=true2018.12 | 78.7 | — | — | — | — | — | |
| S3D-GFine-tuning=true2018.12 | 75.9 | — | — | — | — | — | |
| SupervisedBackbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 75.9 | — | — | — | — | — | |
| I3DFine-tuning=true2018.12 | 74.8 | — | — | — | — | — | |
| R(2+1)DFine-tuning=true2018.12 | 74.5 | — | — | — | — | — | |
| Supervised PretrainingPretrain=Kinetics, Backbone=R(2+1)D, Strategy=Supervised Pretraining, N x H/W=16x1122026.06 | 74.5 | — | — | — | — | — | |
| SupervisedBackbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 74 | — | — | — | — | — | |
| TVNet+IDTFine-tuning=true2018.12 | 72.6 | — | — | — | — | — | |
| ARTNetFine-tuning=true2018.12 | 70.9 | — | — | — | — | — | |
| BraVeCompute=16 TPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^2, Note=pretrained with very high temporal resolutions (2 views of 32 & 128 frames)2021.11 | 70.8 | — | — | — | — | — | |
| VicTRk (shots)=16, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 70.7 | — | — | — | — | — | |
| MMVCompute=32 TPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 70.1 | — | — | — | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 67.4 | — | — | — | — | — | |
| CM-ACCCompute=40 GPUs, Backbone=R(2+1)D-18 (33.4), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 67.2 | — | — | — | — | — | |
| VicTRk (shots)=8, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 66.6 | — | — | — | — | — | |
| Rep. FlowFine-tuning=true2018.12 | 65.4 | — | — | — | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 64.7 | — | — | — | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 64.7 | — | — | — | — | — | |
| X-Florencek (shots)=16, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 64.2 | — | — | — | — | — | |
| X-Florencek (shots)=8, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 64.1 | — | — | — | — | — | |
| X-CLIPk (shots)=16, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 64 | — | — | — | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=32 x 224^22021.11 | 63.7 | — | — | — | — | — | |
| VicTRk (shots)=4, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 63.2 | — | — | — | — | — | |
| XDCPretraining Dataset=IG-Kinetics, Pretraining Size=65M2019.11 | 63.1 | — | — | — | — | — | |
| X-CLIPk (shots)=8, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 62.8 | — | — | — | — | — | |
| GDTCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 62.3 | — | — | — | — | — | |
| CM-ACCCompute=40 GPUs, Backbone=3D-ResNet18 (33.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^2, Dataset samples=240K samples from Kinetics7002021.11 | 61.8 | — | — | — | — | — | |
| XDCPretraining Dataset=IG-Random, Pretraining Size=65M2019.11 | 61.2 | — | — | — | — | — | |
| Supervised PretrainingPretrain=Kinetics, Backbone=R3D-18, Strategy=Supervised Pretraining, N x H/W=8x2242026.06 | 61.2 | — | — | — | — | — | |
| CMACCompute=8 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 61.1 | — | — | — | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 60.8 | — | — | — | — | — | |
| CrissCrossCompute=4 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics-Sound, Finetune input=32 x 224^22021.11 | 60.5 | — | — | — | — | — | |
| VicTRk (shots)=2, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=B/162023.04 | 60 | — | — | — | — | — | |
| Supervised PretrainingPretrain=Kinetics, Backbone=R3D-18, Strategy=Supervised Pretraining, N x H/W=16x1122026.06 | 59.3 | — | — | — | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=8 x 224^22021.11 | 58.3 | — | — | — | — | — | |
| SupervPretraining Dataset=Kinetics, Pretraining Size=240K2019.11 | 58 | — | — | — | — | — | |
| X-Florencek (shots)=4, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 57.8 | — | — | — | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=AudioSet, Finetune input=8 x 224^22021.11 | 57.6 | — | — | — | — | — | |
| X-CLIPk (shots)=4, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 57.3 | — | — | — | — | — | |
| MFNetFine-tuning=true2018.12 | 56.8 | — | — | — | — | — | |
| ActionFlowNetFine-tuning=true2018.12 | 56.4 | — | — | — | — | — | |
| LEViLPretrain=UCF+HMDB+Kineticsb, Backbone=R3D-18, Strategy=LEViLc, N x H/W=8x2242026.06 | 56.2 | — | — | — | — | — | |
| Video-Swin-Bk (shots)=16, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 56.1 | — | — | — | — | — | |
| TimeSformerk (shots)=16, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 55.4 | — | — | — | — | — | |
| Robust-xIDCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 55 | — | — | — | — | — | |
| Res3DFine-tuning=true2018.12 | 54.9 | — | — | — | — | — | |
| DistInitPretrain=Kinetics+Sports-1M, Backbone=R(2+1)D-18, Strategy=DistInit [6], N x H/W=32x1122026.06 | 54.9 | — | — | — | — | — | |
| CrissCrossCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 54.3 | — | — | — | — | — | |
| TCLRPretrain=Kinetics, Backbone=R3D-18, Strategy=TCLR [27], N x H/W=16x1122026.06 | 53.6 | — | — | — | — | — | |
| SupervPretraining Dataset=AudioSet, Pretraining Size=2M2019.11 | 53.5 | — | — | — | — | — | |
| SupervisedBackbone=3D-ResNet18 (33.4), Pre-trained Dataset=Kinetics-Sound, Finetune input=32 x 224^22021.11 | 53.1 | — | — | — | — | — | |
| X-CLIPk (shots)=2, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 53 | — | — | — | — | — | |
| TCLRPretrain=UCF, Backbone=R3D-18, Strategy=TCLR [27], N x H/W=16x1122026.06 | 52.9 | — | — | — | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 52.6 | — | — | — | — | — | |
| C3DFine-tuning=true2018.12 | 51.6 | — | — | — | — | — | |
| X-Florencek (shots)=2, Pre-training=w/ image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 51.6 | — | — | — | — | — | |
| AVIDCompute=64 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 49.5 | — | — | — | — | — | |
| Robust-xIDCompute=8 GPUs, Backbone=R(2+1)D-18 (15.4), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 49.5 | — | — | — | — | — | |
| TimeSformerk (shots)=8, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 49.4 | — | — | — | — | — | |
| VideoMoCoPretrain=Kinetics, Backbone=R(2+1)D-18, Strategy=VideoMoCo [26], N x H/W=32x1122026.06 | 49.2 | — | — | — | — | — | |
| XDCPretraining Dataset=AudioSet, Pretraining Size=2M2019.11 | 48.8 | — | — | — | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=AudioSet, Finetune input=8 x 224^22021.11 | 48.8 | — | — | — | — | — | |
| SpeedNetPretrain=Kinetics, Backbone=S3D-G, Strategy=SpeedNet [22], N x H/W=64x2242026.06 | 48.8 | — | — | — | — | — | |
| Video-Swin-Bk (shots)=8, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 47.9 | — | — | — | — | — | |
| SeLaViCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=32 x 224^22021.11 | 47.1 | — | — | — | — | — | |
| SupervPretraining Dataset=ImageNet, Pretraining Size=1.2M2019.11 | 44.5 | — | — | — | — | — | |
| SpeedNetPretrain=Kinetics, Backbone=I3D, Strategy=SpeedNet [22], N x H/W=64x2242026.06 | 43.7 | — | — | — | — | — | |
| VideoMoCoPretrain=Kinetics, Backbone=R3D-18, Strategy=VideoMoCo [26], N x H/W=32x1122026.06 | 43.6 | — | — | — | — | — | |
| XDCPretraining Dataset=AudioSet-240K, Pretraining Size=240K2019.11 | 42.6 | — | — | — | — | — | |
| Video-Swin-Bk (shots)=4, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 41.3 | — | — | — | — | — | |
| SupervPretraining Dataset=AudioSet-240K, Pretraining Size=240K2019.11 | 40.8 | — | — | — | — | — | |
| CM-ACCCompute=40 GPUs, Backbone=3D-ResNet18 (33.4), Pre-trained Dataset=Kinetics-Sound, Finetune input=32 x 224^22021.11 | 40.6 | — | — | — | — | — | |
| TimeSformerk (shots)=4, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 40.6 | — | — | — | — | — | |
| DistInitPretrain=Kinetics+Sports-1M, Backbone=R(2+1)D-18, Strategy=DistInit [6], N x H/W=8 x1122026.06 | 40.3 | — | — | — | — | — | |
| DistInitPretrain=Kinetics+Sports-1M, Backbone=R3D-18, Strategy=DistInit [6], N x H/W=8 x1122026.06 | 39.9 | — | — | — | — | — | |
| XDCPretraining Dataset=Kinetics, Pretraining Size=240K2019.11 | 39 | — | — | — | — | — | |
| XDCCompute=64 GPUs, Backbone=R(2+1)D-18 (31.5), Pre-trained Dataset=Kinetics400, Finetune input=8 x 224^22021.11 | 39 | — | — | — | — | — | |
| PacePredPretrain=Kinetics, Backbone=R(2+1)D-18, Strategy=PacePred [44], N x H/W=16x1122026.06 | 36.6 | — | — | — | — | — | |
| CSTPPretrain=Kinetics, Backbone=R3D-18, Strategy=CSTP [45], N x H/W=16x1122026.06 | 34.4 | — | — | — | — | — | |
| 3DRotNetPretrain=Kinetics, Backbone=R3D-18, Strategy=3DRotNet [23], N x H/W=16x1122026.06 | 33.7 | — | — | — | — | — | |
| 3D ST-PuzzlePretrain=Kinetics, Backbone=R3D-18, Strategy=3D ST-Puzzle [24], N x H/W=16x1122026.06 | 33.7 | — | — | — | — | — | |
| PMASPretrain=Kinetics, Backbone=C3D, Strategy=PMAS [43], N x H/W=16x1122026.06 | 33.4 | — | — | — | — | — | |
| PMASPretrain=UCF, Backbone=C3D, Strategy=PMAS [43], N x H/W=16x1122026.06 | 32.6 | — | — | — | — | — | |
| TSMk (shots)=16, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 31 | — | — | — | — | — | |
| ClipOrderPretrain=UCF, Backbone=R(2+1)D-18, Strategy=ClipOrder [25], N x H/W=16x1122026.06 | 30.9 | — | — | — | — | — | |
| 3DRotNetPretrain=MiT, Backbone=R3D-18, Strategy=3DRotNet [23], N x H/W=16x1122026.06 | 29.6 | — | — | — | — | — | |
| ClipOrderPretrain=UCF, Backbone=R3D-18, Strategy=ClipOrder [25], N x H/W=16x1122026.06 | 29.5 | — | — | — | — | — | |
| 3D ST-PuzzlePretrain=Kinetics, Backbone=C3D, Strategy=3D ST-Puzzle [24], N x H/W=16x1122026.06 | 28.3 | — | — | — | — | — | |
| NonePretrain=None, Backbone=R3D-18, Strategy=None, N x H/W=16x1122026.06 | 25.3 | — | — | — | — | — | |
| ScratchPretraining Dataset=None, Pretraining Size=02019.11 | 24.1 | — | — | — | — | — | |
| TSMk (shots)=4, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 20.9 | — | — | — | — | — | |
| Video-Swin-Bk (shots)=2, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=50, Backbone=Swin-B2023.04 | 20.9 | — | — | — | — | — | |
| TimeSformerk (shots)=2, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 19.6 | — | — | — | — | — | |
| TSMk (shots)=8, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 18.4 | — | — | — | — | — | |
| TSMk (shots)=2, Pre-training=w/o image-text, Pre-training dataset=Kinetics-400, Finetuning epochs=502023.04 | 17.5 | — | — | — | — | — | |
| (2+1)D ConvPre-training=ImageNet, Modality=RGB2018.11 | — | 27.8 | — | — | — | — |