Action Recognition on COIN
90.4Top-1 AccVideoMamba
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Masked Pretraining=true, Pretraining Dataset=K400, Frames=642024.03 | 90.4 | |
| Distant Supervisionend-to-end=false, Backbone=TimeSformer, Neck Type=Atten. w/ KB, Pretraining Dataset=IN-21K+HTM2024.03 | 90 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Masked Pretraining=true, Pretraining Dataset=K400, Frames=322024.03 | 89.6 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Pretraining Dataset=K400, Frames=642024.03 | 89.5 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-S, Pretraining Dataset=K400, Frames=642024.03 | 88.7 | |
| ViS4merend-to-end=false, Backbone=Swin-B, Neck Type=SSM, Pretraining Dataset=IN-21K+K6002024.03 | 88.4 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-S, Pretraining Dataset=K400, Frames=322024.03 | 88.4 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Pretraining Dataset=K400, Frames=322024.03 | 88.3 | |
| Turboend-to-end=true, Backbone=VideoMAE-B, Pretraining Dataset=K400+HTM-AA, Frames=322024.03 | 87.5 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-Ti, Pretraining Dataset=K400, Frames=642024.03 | 87 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-Ti, Pretraining Dataset=K400, Frames=322024.03 | 86.2 | |
| Turboend-to-end=true, Backbone=VideoMAE-B, Pretraining Dataset=K400, Frames=322024.03 | 82.3 |