Action Recognition on HMDB51 (Mean Accuracy)
81.3Mean AccuracyOurs ViT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| Ours ViT-LModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning, Backbone=ViT-L2022.07 | 81.3 | |
| Ours ViT-L (336↑)Modality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning, Backbone=ViT-L, Resolution=3362022.07 | 81.3 | |
| TDNModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 76.4 | |
| TDNPretrain=ImageNet + Kinetics, Backbone=ResNet502020.12 | 76.3 | |
| S3DPretrain=ImageNet+Kinetics, Backbone=Inception V22020.12 | 75.9 | |
| S3D-GModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 75.9 | |
| MVFNetModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 75.7 | |
| I3DPretrain=ImageNet+Kinetics, Backbone=Inception V22020.12 | 74.8 | |
| I3DModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 74.8 | |
| R(2+1)DPretrain=Kinetics, Backbone=ResNet342020.12 | 74.5 | |
| R(2+1)DModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 74.5 | |
| TSMModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 73.5 | |
| TEAPretrain=ImageNet + Kinetics, Backbone=ResNet502020.12 | 73.3 | |
| TSMPretrain=Kinetics, Backbone=ResNet502020.12 | 73.2 | |
| STMPretrain=ImageNet + Kinetics, Backbone=ResNet502020.12 | 72.2 | |
| STMModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 72.2 | |
| TEINetModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 72.1 | |
| ARTNetPretrain=Kinetics, Backbone=ResNet182020.12 | 70.9 | |
| ARTNetModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 70.9 | |
| GA2-CLIPK=16, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 70.8 | |
| ViLT-CLIPK=16, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 69.6 | |
| GA2-CLIPK=8, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 68.1 | |
| ViFi-CLIPK=16, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 67.4 | |
| ViLT-CLIPK=8, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 66.9 | |
| ViFi-CLIPK=16, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 66.8 | |
| CLIP text-FTK=16, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 65 | |
| ViFi-CLIPK=8, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 64.8 | |
| ViFi-CLIPK=8, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 64.5 | |
| GA2-CLIPK=4, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 64.3 | |
| X-CLIPK=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 64 | |
| CLIP text-FTK=8, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 63.1 | |
| X-CLIPK=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 62.8 | |
| ViFi-CLIPK=4, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 62.7 | |
| A5K=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 62.4 | |
| CLIP image-FTK=16, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 62 | |
| ViLT-CLIPK=4, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 61.9 | |
| GA2-CLIPK=2, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 61.9 | |
| CLIP text-FTK=4, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 61.6 | |
| ViLT-CLIPK=2, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 60.6 | |
| ViFi-CLIPK=4, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 60 | |
| ActionCLIPK=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 59.1 | |
| ActionCLIPK=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 57.9 | |
| CLIP image-FTK=8, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 57.8 | |
| ViFi-CLIPK=2, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 57.8 | |
| ActionCLIPK=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 57.3 | |
| X-CLIPK=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 57.3 | |
| ViFi-CLIPK=2, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 57.2 | |
| A5K=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 56 | |
| C3DPretrain=Sports-1M, Backbone=ResNet182020.12 | 54.9 | |
| CLIP image-FTK=4, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 54.9 | |
| CLIP text-FTK=2, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 54.5 | |
| TSNPretrain=ImageNet, Backbone=Inception V22020.12 | 53.7 | |
| X-CLIPK=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 53 | |
| A5K=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 50.7 | |
| CLIP image-FTK=2, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 49.6 | |
| ActionCLIPK=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 47.5 | |
| Vanilla CLIPK=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 41.9 | |
| Vanilla CLIPK=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 41.9 | |
| Vanilla CLIPK=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 41.9 | |
| Vanilla CLIPK=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 41.9 | |
| A5K=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 39.7 |