Video Action Recognition on HMDB-51 (Mean class accuracy)
75.9Mean Class AccuracyS3D-G
Evaluation Results
| Method | Links | |
|---|---|---|
| S3D-GBackbone=Inception V1, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 75.9 | |
| MVFNetBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Frames=16, Splits=32020.12 | 75.7 | |
| I3DBackbone=Inception V1, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 74.8 | |
| R(2+1)DBackbone=Inception V1, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 74.5 | |
| TSMBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 73.5 | |
| ECO EnBackbone=BNIncep+Res3D-18, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 72.4 | |
| STMBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 72.2 | |
| TEINetBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 72.1 | |
| ARTNetBackbone=ResNet-18, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 70.9 | |
| ViFi-CLIPK=16, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 66.8 | |
| CLIP text-FTK=16, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 65 | |
| ViFi-CLIPK=8, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 64.5 | |
| XCLIPK=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 64 | |
| CLIP text-FTK=8, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 63.1 | |
| XCLIPK=8, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 62.8 | |
| ViFi-CLIPK=4, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 62.7 | |
| A5K=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 62.4 | |
| CLIP image-FTK=16, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 62 | |
| CLIP text-FTK=4, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 61.6 | |
| ActionCLIPK=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 59.1 | |
| ActionCLIPK=4, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 57.9 | |
| CLIP image-FTK=8, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 57.8 | |
| ActionCLIPK=8, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 57.3 | |
| XCLIPK=4, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 57.3 | |
| ViFi-CLIPK=2, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 57.2 | |
| A5K=8, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 56 | |
| CLIP image-FTK=4, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 54.9 | |
| CLIP text-FTK=2, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 54.5 | |
| XCLIPK=2, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 53 | |
| A5K=4, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 50.7 | |
| CLIP image-FTK=2, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 49.6 | |
| ActionCLIPK=2, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 47.5 | |
| Vanilla CLIPK=2, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 41.9 | |
| Vanilla CLIPK=4, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 41.9 | |
| Vanilla CLIPK=8, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 41.9 | |
| Vanilla CLIPK=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 41.9 | |
| A5K=2, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 39.7 |