Video Classification on HMDB-51
80.1Top-1 AccuracyOurs ViT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| Ours ViT-Lshot=All2022.07 | 80.1 | |
| VidTr-MInput=16 x 42021.04 | 74.4 | |
| VidTr-LInput=32 x 22021.04 | 74.4 | |
| I3DInput=32x22021.04 | 74.3 | |
| Ours ViT-Lshot=22022.07 | 73.5 | |
| TEINetInput=16 (TSN)2021.04 | 73.3 | |
| Ours ViT-Lshot=12022.07 | 72.7 | |
| Dynamic Image Network2020.02 | 72.5 | |
| Temporal Squeeze Network2020.02 | 71.5 | |
| TSMInput=8(TSN)2021.04 | 70.7 | |
| TSNBackbone=BN-Inception2020.02 | 69.4 | |
| Two-Stream Fusion+iDT2020.02 | 69.2 | |
| EVERESTBackbone=ViT-B, Extra data=None2022.11 | 68.1 | |
| Two-Stream I3D2020.02 | 66.4 | |
| TDD+iDT2020.02 | 65.9 | |
| RSPNetBackbone=S3D-G, Extra data=K4002022.11 | 64.7 | |
| VideoMAEBackbone=ViT-B, Extra data=None2022.11 | 62.6 | |
| iDT+HSV2020.02 | 61.1 | |
| Two-Streamfusion=SVM2020.02 | 59.4 | |
| iDT+Fisher vector2020.02 | 57.2 | |
| VideoPromptshot=52022.07 | 56.6 | |
| Vi² CLRBackbone=S3D, Extra data=K4002022.11 | 55.7 | |
| CoCLRBackbone=S3D-G, Extra data=K4002022.11 | 54.6 | |
| Ours ViT-Lshot=02022.07 | 53.8 | |
| Vi² CLRBackbone=S3D, Extra data=UCF1012022.11 | 52.9 | |
| CoCLRBackbone=S3D-G, Extra data=UCF1012022.11 | 52.1 | |
| X-Florenceshot=22022.07 | 51.6 | |
| VCOPBackbone=R(2+1)D, Extra data=UCF1012022.11 | 30.9 | |
| VideoSwinshot=22022.07 | 20.9 |