Spatiotemporal Action Localization on AVA 2.2
41.7mAPSTAR/L*
Evaluation Results
| Method | Links | |
|---|---|---|
| STAR/L*Pretraining=CLIP→K700, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=true, Trained on=AVA-Kinetics2023.04 | 41.7 | |
| InternVideoHead=Linear2022.12 | 41.01 | |
| InternVideo*Pretraining=7 different datasets, Backbone=Uniformer v2, End-to-end=false, Trained on=AVA-Kinetics2023.04 | 41 | |
| VideoMAEPretraining=SSL K700 → Sup. K700, Resolution=256, Backbone=ViViT/L, End-to-end=false2023.04 | 39.3 | |
| STAR/LPretraining=CLIP→K700, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=true2023.04 | 39.2 | |
| STAR/LPretraining=JFT→WTS, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=true2023.04 | 39 | |
| MaskFeatHead=not specified2022.12 | 38.8 | |
| STAR/BPretraining=JFT→WTS, Views=1, Resolution=320, Backbone=ViViT/B, End-to-end=true2023.04 | 36.3 | |
| Co-finetuningPretraining=JFT, WTS→K700, MiT, SSv2, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=false2023.04 | 36.1 | |
| MeMVITPretraining=K700, Resolution=312, Backbone=MViT v2, End-to-end=false2023.04 | 34.4 | |
| STAR/BPretraining=CLIP→K700, Views=1, Resolution=320, Backbone=ViViT/B, End-to-end=true2023.04 | 33.9 | |
| TubeRPretraining=Instagram65M [36]→K400, Views=2, Resolution=256, Backbone=CSN-152, End-to-end=true2023.04 | 33.6 | |
| ACARHead=ACAR [77], Ensemble=true2022.12 | 33.3 | |
| ACARPretraining=K700, Views=6, Resolution=320, Backbone=SlowFast, End-to-end=false2023.04 | 33.3 | |
| Co-finetuningPretraining=IN21K→K700, MiT, SSv2, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=false2023.04 | 32.8 | |
| AIAPretraining=K700, Views=18, Resolution=320, Backbone=SlowFast, End-to-end=false2023.04 | 32.3 | |
| STAR/BPretraining=IN21K→K400, Views=1, Resolution=320, Backbone=ViViT/B, End-to-end=true2023.04 | 30 | |
| WOOPretraining=K600, Views=1, Resolution=320, Backbone=SlowFast, End-to-end=true2023.04 | 28.3 | |
| UnifiedPretraining=K400, Views=6, Resolution=320, Backbone=SlowFast, End-to-end=false2023.04 | 27.7 | |
| MViT-BPretraining=K400, Views=1, Backbone=MViT, End-to-end=false2023.04 | 27.3 | |
| Action TransformerPretraining=K400, Views=1, Resolution=400, Backbone=I3D, End-to-end=true2023.04 | 23 |