Action Recognition on Breakfast
97.9Top-1 AccuracyVideoMamba
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Masked Pretraining=true, Pretraining Dataset=K400, Frames=322024.03 | 97.9 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-S, Pretraining Dataset=K400, Frames=642024.03 | 97.4 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Masked Pretraining=true, Pretraining Dataset=K400, Frames=642024.03 | 96.9 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Pretraining Dataset=K400, Frames=642024.03 | 95.8 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-S, Pretraining Dataset=K400, Frames=322024.03 | 95.3 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-M, Pretraining Dataset=K400, Frames=322024.03 | 94.8 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-Ti, Pretraining Dataset=K400, Frames=322024.03 | 94.3 | |
| VideoMambaend-to-end=true, Backbone=VideoMamba-Ti, Pretraining Dataset=K400, Frames=642024.03 | 94.3 | |
| MA-LMM2024.04 | 93 | |
| Turboend-to-end=true, Backbone=VideoMAE-B, Pretraining Dataset=K400+HTM-AA, Frames=322024.03 | 91.3 | |
| S52024.04 | 90.7 | |
| Distant Supervisionend-to-end=false, Backbone=TimeSformer, Neck Type=Atten. w/ KB, Pretraining Dataset=IN-21K+HTM2024.03 | 89.9 | |
| D-Sprv.2024.04 | 89.9 | |
| ViS4merend-to-end=false, Backbone=Swin-B, Neck Type=SSM, Pretraining Dataset=IN-21K+K6002024.03 | 88.2 | |
| ViS4mer2024.04 | 88.2 | |
| Turboend-to-end=true, Backbone=VideoMAE-B, Pretraining Dataset=K400, Frames=322024.03 | 86.8 | |
| Ours-cumulativeBackbone=ResNet50, #Frames=all, #Clusters=162021.03 | 76.6 | |
| GHRMend-to-end=false, Backbone=I3D, Neck Type=Graph Conv., Pretraining Dataset=IN-1K+K4002024.03 | 75.5 | |
| GHRM2024.04 | 75.5 | |
| Ours-slopeBackbone=ResNet50, #Frames=all, #Clusters=162021.03 | 74.9 | |
| TSMBackbone=ResNet50, #Frames=162021.03 | 72.1 | |
| Timeceptionend-to-end=false, Backbone=3D-ResNet, Neck Type=Conv., Pretraining Dataset=IN-1K+K4002024.03 | 71.3 | |
| Timeception2024.04 | 71.3 | |
| VideoGraphend-to-end=false, Backbone=I3D, Neck Type=Conv. Atten., Pretraining Dataset=IN-1K+K4002024.03 | 69.5 | |
| VideoGraph2024.04 | 69.5 | |
| VideoGraphBackbone=ResNet152, #Frames=642021.03 | 59.1 | |
| ActionVLADBackbone=ResNet152, #Frames=642021.03 | 55.5 | |
| ResNet-152Backbone=ResNet152, #Frames=642021.03 | 41.1 |