Video Action Recognition on SS v2 (ACC@1)
76.8Top-1 Accuracy (SS v2)VideoMAE V2
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoMAE V22025.09 | 76.8 | |
| V-JEPA2-LModel Size=Large2026.03 | 73.7 | |
| V-JEPA-2Params (M)=355, FLOPs (G×T×S)=935×2×32026.05 | 73.7 | |
| LookWhen (70% sparse)Params (M)=106, FLOPs (G×T×S)=108×2×3, sparsity=70%2026.05 | 72 | |
| VideoMAEv2Params (M)=87, FLOPs (G×T×S)=180×2×32026.05 | 71.2 | |
| VideoMamba-M800eParams (M)=74, FLOPs (G×T×S)=202×2×32026.05 | 71 | |
| UMT-B800eParams (M)=87, FLOPs (G×T×S)=180×2×32026.05 | 70.8 | |
| VideoMAEParams (M)=87, FLOPs (G×T×S)=180×2×32026.05 | 70.8 | |
| VideoMAE + RLT (τ=0.1)Params (M)=87, FLOPs (G×T×S)=120×4×32026.05 | 70.2 | |
| InternVideo2Params (M)=1020, FLOPs (G×T×S)=2500×2×32026.05 | 69.7 | |
| VideoMAE + ToMe (r=64)Params (M)=87, FLOPs (G×T×S)=131×4×32026.05 | 69.7 | |
| VideoMAE + vid-TLDRParams (M)=87, FLOPs (G×T×S)=57×unk2026.05 | 69.6 | |
| VideoMambaProParams (M)=72, FLOPs (G×T×S)=183×4×32026.05 | 69.4 | |
| LookWhen (90% sparse)Params (M)=106, FLOPs (G×T×S)=40×2×3, sparsity=90%2026.05 | 69.3 | |
| OmniStream2026.03 | 68.5 | |
| VideoMAE + LITE (K=0.3)Params (M)=87, FLOPs (G×T×S)=46×2×32026.05 | 68.3 | |
| VideoSwin + STTSParams (M)=89, FLOPs (G×T×S)=190×1×32026.05 | 68.1 | |
| NoFrame2025.09 | 62.7 | |
| TSM2025.09 | 61.7 | |
| DINOv3-LModel Size=Large2026.03 | 54 | |
| MoTIF-STBackbone=PE-G/142025.09 | 41.9 | |
| MoTIFBackbone=PE-G/142025.09 | 40.4 | |
| MoTIFBackbone=PE-L/142025.09 | 37.3 | |
| Global CBMBackbone=PE-G/14, Evaluation Protocol=Supervised2025.09 | 33.6 | |
| MoTIFBackbone=ViT-L/142025.09 | 25.8 | |
| Zero-shotBackbone=PE-G/14, Evaluation Protocol=Zero-shot2025.09 | 2.2 |