Action Detection on AVA v2.2
43.3mAPHiera-H
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Hiera-Hbackbone=Hiera-H, pretrain=MAE, pre-training dataset=Kinetics-7002023.06 | 43.3 | — | — | 1,158 | — | |
| Hiera-Hbackbone=Hiera-H, pretrain=MAE, pre-training dataset=Kinetics-6002023.06 | 42.8 | — | — | 1,158 | — | |
| Hiera-Hbackbone=Hiera-H, pretrain=MAE, pre-training dataset=Kinetics-4002023.06 | 42.5 | — | — | 1,158 | — | |
| Hiera-Lbackbone=Hiera-L, pretrain=MAE, pre-training dataset=Kinetics-7002023.06 | 41.7 | — | — | 413 | — | |
| Hiera-Lbackbone=Hiera-L, pretrain=MAE, pre-training dataset=Kinetics-6002023.06 | 40.7 | — | — | 413 | — | |
| ViT-Hbackbone=ViT-H, pretrain=MAE, pre-training dataset=Kinetics-6002023.06 | 40.3 | — | — | 1,193 | — | |
| ViT-Hbackbone=ViT-H, pretrain=MAE, pre-training dataset=Kinetics-7002023.06 | 40.1 | — | — | 1,193 | — | |
| Hiera-Lbackbone=Hiera-L, pretrain=MAE, pre-training dataset=Kinetics-4002023.06 | 39.8 | — | — | 413 | — | |
| MViTv2-L40,312backbone=MViTv2-L40,312, pretrain=MaskFeat, pre-training dataset=Kinetics-6002023.06 | 39.8 | — | — | 2,828 | — | |
| ViT-Hbackbone=ViT-H, pretrain=MAE, pre-training dataset=Kinetics-4002023.06 | 39.5 | — | — | 1,192 | — | |
| ViT-Lbackbone=ViT-L, pretrain=MAE, pre-training dataset=Kinetics-7002023.06 | 39.5 | — | — | 598 | — | |
| MViTv2-L40,312backbone=MViTv2-L40,312, pretrain=MaskFeat, pre-training dataset=Kinetics-4002023.06 | 38.5 | — | — | 2,828 | — | |
| ViT-Lbackbone=ViT-L, pretrain=MAE, pre-training dataset=Kinetics-6002023.06 | 38.4 | — | — | 598 | — | |
| ViT-Lbackbone=ViT-L, pretrain=MAE, pre-training dataset=Kinetics-4002023.06 | 37 | — | — | 597 | — | |
| MAEpre-train set=IG-uncurated, # pre-train data=1M, Backbone=ViT-L, pre-training epochs=16002022.05 | 34.2 | — | — | — | — | |
| AMDBackbone=ViT-B, Extra labels=true, T x tau=16x42023.11 | 33.5 | — | — | — | — | |
| MAEpre-train set=K700, # pre-train data=537k, Backbone=ViT-L, pre-training epochs=16002022.05 | 33.1 | — | — | — | — | |
| MAEpre-train set=K600, # pre-train data=387k, Backbone=ViT-L, pre-training epochs=16002022.05 | 32.5 | — | — | — | — | |
| VideoMAEBackbone=ViT-B, Extra labels=true, T x tau=16x42023.11 | 31.8 | — | — | — | — | |
| VideoMAE-BPretrain=K400, Frames=162023.10 | 31.8 | — | — | — | — | |
| TTMBackbone=ViViT-B, Sequential modeling type=per box, Number of layers=4, Pre-training=Kinetics-4002022.11 | 31.5 | — | — | 2 | — | |
| TTMBackbone=ViViT-B, Sequential modeling type=per box, Number of layers=1, Pre-training=Kinetics-4002022.11 | 31.3 | — | — | 1 | — | |
| MAEpre-train set=K400, # pre-train data=240k, Backbone=ViT-L, pre-training epochs=16002022.05 | 31.1 | — | — | — | — | |
| AMDBackbone=ViT-B, Extra labels=false, T x tau=16x42023.11 | 29.9 | — | — | — | — | |
| MeMViTBackbone=MViT, Sequential modeling type=memory, Pre-training=Kinetics-4002022.11 | 28.5 | — | — | 1.3 | — | |
| MViTv2-BPretrain=K400, Frames=322023.10 | 28.1 | — | — | — | — | |
| TTMBackbone=ViViT-B, Sequential modeling type=per video, Pre-training=Kinetics-4002022.11 | 27.9 | — | — | 0.8 | — | |
| VideoMAEBackbone=ViT-B, Extra labels=false, T x tau=16x42023.11 | 26.7 | — | — | — | — | |
| VideoMAE-BPretrain=K400 wo/labels, Frames=162023.10 | 26.7 | — | — | — | — | |
| ZeroI2V ViT-B/16Pretrain=CLIP, Frames=82023.10 | 26.4 | — | — | — | — | |
| MAEpre-train set=ImageNet-1K, # pre-train data=1.28M, Backbone=ViT-L2022.05 | 26.3 | — | — | — | — | |
| MViTPre-training=Kinetics-4002022.11 | 26.2 | — | — | — | — | |
| ViViT-BPre-training=Kinetics-4002022.11 | 25.2 | — | — | — | — | |
| supervisedBackbone=SlowFast-R101, Extra labels=true, T x tau=8x82023.11 | 23.8 | — | — | — | — | |
| SlowFast-R101Pretrain=K400, Frames=82023.10 | 23.8 | — | — | — | — | |
| ρBYOL p=3Backbone=SlowOnly-R50, Extra labels=false, T x tau=8x82023.11 | 23.4 | — | — | — | — | |
| ViT-Lbackbone=ViT-L, pretrain=supervised, pre-training dataset=Kinetics-4002023.06 | 22.2 | — | — | 598 | — | |
| Supervisedpre-train set=K400, # pre-train data=240k, Backbone=ViT-L2022.05 | 21.6 | — | — | — | — | |
| ρMoCo p=3Backbone=SlowOnly-R50, Extra labels=false, T x tau=8x82023.11 | 20.3 | — | — | — | — | |
| CLIP ViT-B/16Pretrain=CLIP, Frames=82023.10 | 18.3 | — | — | — | — | |
| Supervisedpre-train set=ImageNet-1K, # pre-train data=1.28M, Backbone=ViT-L2022.05 | 17.3 | — | — | — | — | |
| CVRLBackbone=SlowOnly-R50, Extra labels=false, T x tau=32x22023.11 | 16.3 | — | — | — | — | |
| ACAR R101, 8×8+NLpre-train=K6002021.12 | — | 31.4 | — | — | — | |
| ACAR R101, 8×8+NLpre-train=K7002021.12 | — | 33.3 | — | — | — | |
| MViT-L↑312, 40×3 (MaskFeat)pre-train=MaskFeat, K400, FLOPs=2828, Param=2182021.12 | — | 37.3 | 38.5 | — | — | |
| MViT-L↑312, 40×3 (MaskFeat)pre-train=MaskFeat, K600, FLOPs=2828, Param=2182021.12 | — | 38.8 | 39.8 | — | — | |
| MViT-L↑312, 40×3 (Supervised)pre-train=IN-21K+K400, FLOPs=2828, Param=2182021.12 | — | 31.6 | — | — | — | |
| MViTv1-B-24, 32×3pre-train=K600, FLOPs=236, Param=532021.12 | — | 28.7 | — | — | — | |
| MViTv1-B, 64×3pre-train=K400, FLOPs=455, Param=362021.12 | — | 27.3 | — | — | — | |
| Object Transformerpre-train=K600, FLOPs=244, Param=862021.12 | — | 31 | — | — | — | |
| SlowFast 16×8+NLpre-train=K600, FLOPs=296, Param=592021.12 | — | 27.5 | — | — | — | |
| SlowFast R101, 8×8pre-train=K400, FLOPs=138, Param=532021.12 | — | 23.8 | — | — | — | |
| X3D-XLpre-train=K600, FLOPs=48, Param=112021.12 | — | 27.4 | — | — | — |