Action Recognition on Charades
0.6229mAPAssembleNet++ 50 ODF+SDF (exact)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AssembleNet++ 50 ODF+SDF (exact)Backbone=AssembleNet++ 50, Pre-training=none, ODF/SDF Configuration=exact2020.01 | 0.6229 | — | — | |
| AssembleNet++ 50 ODF+SDF (SK1024)Backbone=AssembleNet++ 50, Pre-training=none, ODF/SDF Configuration=SK10242020.01 | 0.6198 | — | — | |
| AssembleNet++ 50 ODF+SDF (SK512)Backbone=AssembleNet++ 50, Pre-training=none, ODF/SDF Configuration=SK5122020.01 | 0.6071 | — | — | |
| AssembleNet-101pre-train=Kinetics, modality=RGB+Flow2019.05 | 0.586 | — | — | |
| AssembleNet-101#Frames=128, #Views=5x1, GFLOPs=12002023.04 | 0.586 | — | — | |
| VicTR (L/14)Pretrain=CLIP, #Frames=32, #Views=4x1, GFLOPs=26022023.04 | 0.576 | — | — | |
| AssembleNet++ 50 ODF+SDF (exact)Backbone=AssembleNet++ 50, Pre-training=Kinetics-400, ODF/SDF Configuration=exact2020.01 | 0.573 | — | — | |
| AssembleNet++ 50 ODF+SDF (SK1024)Backbone=AssembleNet++ 50, Pre-training=Kinetics-400, ODF/SDF Configuration=SK10242020.01 | 0.5694 | — | — | |
| AssembleNet++ 50 baselineBackbone=AssembleNet++ 50, Pre-training=none, ODF/SDF Configuration=baseline2020.01 | 0.567 | — | — | |
| AssembleNet-50pre-train=Kinetics, modality=RGB+Flow2019.05 | 0.566 | — | — | |
| AssembleNet++ 50 ODF+SDF (SK512)Backbone=AssembleNet++ 50, Pre-training=Kinetics-400, ODF/SDF Configuration=SK5122020.01 | 0.5581 | — | — | |
| AssembleNet++ 50 baselineBackbone=AssembleNet++ 50, Pre-training=Kinetics-400, ODF/SDF Configuration=baseline2020.01 | 0.538 | — | — | |
| AssembleNet-50pre-train=MiT, modality=RGB+Flow2019.05 | 0.53 | — | — | |
| 2-stream (2+1)D ResNet-101pre-train=Kinetics, modality=RGB+Flow2019.05 | 0.506 | — | — | |
| 2-stream (2+1)D ResNet-50pre-train=Kinetics, modality=RGB+Flow2019.05 | 0.504 | — | — | |
| VicTR (B/16)Pretrain=CLIP, #Frames=32, #Views=4x1, GFLOPs=5672023.04 | 0.501 | — | — | |
| 2-stream (2+1)D ResNet-50pre-train=MiT, modality=RGB+Flow2019.05 | 0.487 | — | — | |
| MVITPretrain=K400, #Frames=32, #Views=10x3, GFLOPs=2372023.04 | 0.477 | — | — | |
| AssembleNet-50pre-train=None, modality=RGB+Flow2019.05 | 0.47 | — | — | |
| SlowFast-101pre-train=Kinetics, modality=RGB+RGB2019.05 | 0.452 | — | — | |
| CLIP Hitchhiker'sPretrain=CLIP, #Frames=32, #Views=1x12023.04 | 0.449 | — | — | |
| ActionCLIPPretrain=CLIP, #Frames=32, #Views=10x3, GFLOPs=5632023.04 | 0.446 | — | — | |
| ActionCLIPbackbone=ViT-B/16, Frames=322021.09 | 0.443 | — | — | |
| X3D-XL (312)Pretrain=K400, #Frames=16, #Views=10x3, GFLOPs=482023.04 | 0.434 | — | — | |
| X3D-XL (312)Frames=162021.09 | 0.434 | — | — | |
| LFB-101pre-train=Kinetics, modality=RGB2019.05 | 0.425 | — | — | |
| LFB-101Pretrain=K400, #Frames=32, #Views=10x3, GFLOPs=5292023.04 | 0.425 | — | — | |
| SlowFast-101 + NLPretrain=K400, #Frames=16+64, #Views=10x3, GFLOPs=2342023.04 | 0.425 | — | — | |
| SlowFast 101+NLFrames=16+642021.09 | 0.425 | — | — | |
| LFB+NLFrames=322021.09 | 0.425 | — | — | |
| Timeception2021.09 | 0.411 | — | — | |
| 2-stream (2+1)D ResNet-50pre-train=None, modality=RGB+Flow2019.05 | 0.399 | — | — | |
| STRGpre-train=Kinetics, modality=RGB2019.05 | 0.397 | — | — | |
| STGR+NL2021.09 | 0.397 | — | — | |
| EvaNetPretrain=K400, #Frames=642023.04 | 0.381 | — | — | |
| SlowFast-50Pretrain=K400, #Frames=8+32, #Views=10x3, GFLOPs=662023.04 | 0.38 | — | — | |
| SlowFast 50Frames=8+322021.09 | 0.38 | — | — | |
| I3D-NLpre-train=Kinetics, modality=RGB2019.05 | 0.375 | — | — | |
| I3D + NLPretrain=K400, #Frames=128, #Views=10x3, GFLOPs=5442023.04 | 0.375 | — | — | |
| Nonlocal2021.09 | 0.375 | — | — | |
| I3D (from Wang et al., 2018)pre-train=Kinetics, modality=RGB2019.05 | 0.355 | — | — | |
| STMFrames=162021.09 | 0.353 | — | — | |
| I3Dpre-train=Kinetics, modality=RGB2019.05 | 0.329 | — | — | |
| CLIP4clipPretrain=CLIP, #Frames=32, #Views=1x12023.04 | 0.32 | — | — | |
| TRN2017.11 | 0.252 | — | — | |
| MultiScale TRNpre-train=ImageNet, modality=RGB2019.05 | 0.252 | — | — | |
| MultiScale TRN2021.09 | 0.252 | — | — | |
| CoVIAR + optical flowoptical flow usage=With optical flow2017.12 | 0.241 | 0.323 | — | |
| Sigurdsson et al.optical flow usage=With optical flow2017.12 | 0.224 | — | — | |
| TempField2017.11 | 0.224 | — | — | |
| Asyn-TFpre-train=UCF101, modality=RGB+Flow2019.05 | 0.224 | — | — | |
| CoVIARoptical flow usage=Without optical flow2017.12 | 0.219 | 0.294 | — | |
| CoViARpre-train=ImageNet, modality=Compressed2019.05 | 0.219 | — | — | |
| ActionVLAD + iDToptical flow usage=With optical flow, input modality=RGB only2017.12 | 0.21 | 0.299 | — | |
| Two-stream + iDToptical flow usage=With optical flow, source=from [32]2017.12 | 0.186 | — | — | |
| 2-streampre-train=UCF101, modality=RGB+Flow2019.05 | 0.186 | — | — | |
| Sigurdsson et al.optical flow usage=Without optical flow, input modality=RGB only2017.12 | 0.183 | — | — | |
| ActionVLADoptical flow usage=Without optical flow, input modality=RGB only2017.12 | 0.176 | 0.251 | — | |
| IDT2017.11 | 0.172 | — | — | |
| Two-streamoptical flow usage=With optical flow, source=from [32]2017.12 | 0.143 | — | — | |
| 2-Stream2017.11 | 0.143 | — | — | |
| AlexNet2017.11 | 0.113 | — | — | |
| C3D2017.11 | 0.109 | — | — | |
| Random2017.11 | 0.059 | — | — | |
| InternVideo2_clip-1B#F=8, Training Data=IV-25.5M, protocol=Zero-shot2024.03 | — | — | 0.329 | |
| InternVideo2_clip-6B#F=8, Training Data=IV-400M, protocol=Zero-shot2024.03 | — | — | 0.346 |