Spatio-temporal Action Localization on AVA-Kinetics v1.0
44.6mAPSTAR/L
Evaluation Results
| Method | Links | |
|---|---|---|
| STAR/LPretraining=JFT→WTS, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=true2023.04 | 44.6 | |
| STAR/LPretraining=CLIP→K700, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=true2023.04 | 44.5 | |
| STAR/L*Pretraining=CLIP→K700, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=true2023.04 | 44.5 | |
| InternVideo*Pretraining=7 different datasets, Backbone=Uniformer v2, End-to-end=false2023.04 | 42.5 | |
| STAR/BPretraining=JFT→WTS, Views=1, Resolution=320, Backbone=ViViT/B, End-to-end=true2023.04 | 41.8 | |
| STAR/BPretraining=CLIP→K700, Views=1, Resolution=320, Backbone=ViViT/B, End-to-end=true2023.04 | 39.1 | |
| STAR/BPretraining=IN21K→K400, Views=1, Resolution=320, Backbone=ViViT/B, End-to-end=true2023.04 | 36.6 | |
| ACARPretraining=K700, Views=6, Resolution=320, Backbone=SlowFast, End-to-end=false2023.04 | 36.4 | |
| Co-finetuningPretraining=JFT, WTS→K700, MiT, SSv2, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=false2023.04 | 36.2 | |
| Co-finetuningPretraining=IN21K→K700, MiT, SSv2, Views=1, Resolution=320, Backbone=ViViT/L, End-to-end=false2023.04 | 33.1 |