Spatial-temporal action detection on AVA v2
13.7mAPTrajViT
Evaluation Results
| Method | Links | |
|---|---|---|
| TrajViTTraining subset=4M, Inference frames=162025.05 | 13.7 | |
| ViT3DTraining subset=4M, Inference frames=162025.05 | 10.6 | |
| ViViTTraining subset=4M, Inference frames=162025.05 | 9.9 | |
| TokenLearnerTraining subset=4M, Inference frames=162025.05 | 9.1 | |
| RLTTraining subset=4M, Inference frames=162025.05 | 8.5 | |
| ToMeTraining subset=4M, Inference frames=162025.05 | 8.3 |