Spatio-temporal Action Detection on AVA V2.2
33.6Frame mAPTubeR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TubeRPretrain=IG + 4002022.10 | 33.6 | — | |
| MeMViTPretrain=K7002022.10 | 33.5 | — | |
| ACARPretrain=K7002022.10 | 33.3 | — | |
| HITPretrain=K7002022.10 | 32.6 | — | |
| AIAPretrain=K7002022.10 | 32.3 | — | |
| Beyond Short ClipsPretrain=K7002022.10 | 31.6 | — | |
| Object TransformerPretrain=K6002022.10 | 31 | — | |
| X3D-LPretrain=K6002022.10 | 29.4 | — | |
| SlowFast, R-101+NLPretrain=K6002022.10 | 29 | — | |
| MViT-Bsampling=16 x 4, Boxes=true, Pretrain=K4002021.10 | — | 25.5 | |
| MViT-Bsampling=32 x 3, Boxes=true, Pretrain=K4002021.10 | — | 27.3 | |
| ORViTbackbone=MViT-B, sampling=16 x 4, Boxes=true, Pretrain=K4002021.10 | — | 26.6 | |
| ORViTbackbone=MViT-B, sampling=32 x 3, Boxes=true, Pretrain=K4002021.10 | — | 28 | |
| SlowFastsampling=4 x 16, backbone=R50, Boxes=true, Pretrain=K4002021.10 | — | 21.9 | |
| SlowFastsampling=8 x 8, backbone=R50, Boxes=true, Pretrain=K4002021.10 | — | 22.7 | |
| SlowFastsampling=8 x 8, backbone=R101, Boxes=true, Pretrain=K4002021.10 | — | 23.8 |