Action Recognition on Diving48
87.3Top-1 AccuracySIFAR-B-14+
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SIFAR-B-14+Backbone=Swin-B, Frames=16, Computational Cost (GFLOPs)=263.02026.06 | 87.3 | 98.8 | |
| MamBOA (Ours, Video)Backbone=MViT-V2-S, Frames=Full-video, Computational Cost (GFLOPs)=407.62026.06 | 86.24 | 97.72 | |
| SIFAR-B-12+Backbone=Swin-B, Frames=16, Computational Cost (GFLOPs)=189.02026.06 | 85.3 | 98.3 | |
| MamBOA (Ours, Image)Backbone=VMamba-B, Frames=30 × 16, Computational Cost (GFLOPs)=30 × 132.5ᵃ2026.06 | 85.02 | 98.53 | |
| TDN (Base)Backbone=ResNet-50, Frames=16, Computational Cost (GFLOPs)=72.02026.06 | 84.6 | — | |
| TSMBackbone=ResNet-50, Frames=16, Computational Cost (GFLOPs)=65.02026.06 | 83.2 | — | |
| TimeSformer-LBackbone=Transformer, Frames=96, Computational Cost (GFLOPs)=2,380.02026.06 | 81 | — | |
| ViViT-LBackbone=Transformer, Frames=32, Computational Cost (GFLOPs)=7,248.02026.06 | 80.6 | 92.7 | |
| TSN (baseline)Backbone=ResNet-50, Frames=16, Computational Cost (GFLOPs)=33.02026.06 | 79 | — | |
| GSTBackbone=ResNet-50, Frames=16, Computational Cost (GFLOPs)=58.42026.06 | 78.9 | — | |
| TimeSformer-HRBackbone=Transformer, Frames=16, Computational Cost (GFLOPs)=170.32026.06 | 78 | — | |
| SlowFast (16×8)Backbone=ResNet-101, Frames=64+16, Computational Cost (GFLOPs)=213.02026.06 | 77.6 | — | |
| VideoSwin-BBackbone=Transformer, Frames=32, Computational Cost (GFLOPs)=963.02026.06 | 69.6 | 92.7 |