Action Recognition on Something-Something v2 (Inferred vs Ground Truth Boxes)
70Top-1 Acc (Inferred Boxes)ObjectViViT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ObjectViViTn. FLOPs=1.06x, Temporal views=2, Spatial crops=3, Token sampling percentage=50%2023.06 | 70 | 74.2 | |
| ObjectViViTn. FLOPs=1.06x, Temporal views=1, Spatial crops=32023.06 | 68.5 | 73 | |
| VideoMAE w. ORVIT (reproduced)n. FLOPs=1.06x, Temporal views=1, Spatial crops=32023.06 | 68.3 | 72.8 | |
| MFormer w. ORVITn. FLOPs=1.09x, Temporal views=1, Spatial crops=32023.06 | 67.9 | — | |
| MFormern. FLOPs=1x (370), Temporal views=1, Spatial crops=32023.06 | 66.5 | — | |
| VideoMAE (our baseline)n. FLOPs=1x (181), Temporal views=1, Spatial crops=32023.06 | 64.8 | — | |
| MFormer w. ObjectLearnern. FLOPs=1.04x, Temporal views=1, Spatial crops=32023.06 | — | 74 |