Spatio-temporal Action Detection on AVA v2.2 (val)
32.3mAPEVAD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EVADBackbone=ViT-B, Pretraining=K400, K=16, A=100%2024.12 | 32.3 | — | 243 | |
| STMixerBackbone=CSN-152, Pretraining=IG-65M, K=32, A=100%2024.12 | 31.7 | 3 | 120 | |
| BMVITBackbone=ViT-B, Pretraining=K400, MAE, K=16, A=100%2024.12 | 31.4 | — | 350 | |
| TubeRBackbone=CSN-152, Pretraining=IG-65M, K=32, A=100%2024.12 | 29.7 | 3 | 120 | |
| SE-STADBackbone=SF-R101, Pretraining=K400, K=8, A=100%2024.12 | 29.3 | — | 165 | |
| WOOBackbone=SF-R101, Pretraining=K600, K=8, A=100%2024.12 | 28.3 | — | 252 | |
| YOWOBackbone=ResNext-101, Pretraining=K400, K=16, A=100%2024.12 | 17.9 | 35 | 44 | |
| YOWOv2-NBackbone=Shufflev2-1.0x, Pretraining=K400, K=16, A=100%2024.12 | 12.6 | 40 | 1.3 | |
| Stable Mean TeacherBackbone=Shufflev2-1.0x, Pretraining=K400, K=16, A=10%2024.12 | 8.5 | 40 | 1.3 | |
| Supervised baselineBackbone=Shufflev2-1.0x, Pretraining=K400, K=16, A=10%2024.12 | 5.2 | 40 | 1.3 |