Video Violence Detection on Combined Dataset
95.85Top-1 AccuracyFuseMamba-VD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FuseMamba-VDArchitecture=SSM, Pretraining=K-400, Input Size=64×224², Params. (M)=154.3, FLOPs (G)=19122025.05 | 95.85 | 95.89 | 95.81 | |
| CUE-NetArchitecture=CNN+Trans., Pretraining=K-400, Input Size=64×224², Params. (M)=354, FLOPs (G)=59062025.05 | 94.97 | 94.92 | 95.02 | |
| VideoMamba-MArchitecture=SSM, Pretraining=K-400, Input Size=64×224², Params. (M)=74, FLOPs (G)=8062025.05 | 92.9 | 92.8 | 92.99 | |
| VideoMamba-LArchitecture=SSM, Pretraining=K-400, Input Size=64×224², Params. (M)=148, FLOPs (G)=16442025.05 | 92.46 | 92.22 | 92.68 | |
| VideoMambaPro-MArchitecture=SSM, Pretraining=K-400, Input Size=64×224², Params. (M)=76, FLOPs (G)=10282025.05 | 92.13 | 90.75 | 93.16 | |
| Uniformer-V2Architecture=CNN+Trans., Pretraining=K-400, Input Size=64×224², Params. (M)=354, FLOPs (G)=61082025.05 | 91.81 | 91.93 | 91.68 | |
| VideoSwin-BArchitecture=Trans., Pretraining=K-400, Input Size=64×224², Params. (M)=88, FLOPs (G)=281.62025.05 | 82.62 | 83.49 | 81.85 | |
| SlowFastArchitecture=CNN, Pretraining=-, Input Size=64×224², Params. (M)=60, FLOPs (G)=2342025.05 | 74.21 | 70.46 | 77.21 |