Video Action Recognition on SS v2
19.6Base ScoreTC-CLIP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TC-CLIPPre-trained=Kinetics-400, Evaluation Protocol=Base-to-novel generalization2024.04 | 19.6 | 15.6 | 17.4 | |
| GA2-CLIPAdaptation Strategy=Prompt tuning pre-trained image VL models2025.11 | 18.7 | 14.3 | 16.2 | |
| ViLT-CLIPAdaptation Strategy=Prompt tuning pre-trained image VL models2025.11 | 17.3 | 12.8 | 14.7 | |
| ViFi-CLIPAdaptation Strategy=Tuning pre-trained image VL models2025.11 | 16.2 | 12.1 | 13.9 | |
| ViFi-CLIPPre-trained=Kinetics-400, Evaluation Protocol=Base-to-novel generalization2024.04 | 15.8 | 11.5 | 13.3 | |
| ViFi-CLIPAdaptation Strategy=Prompt tuning pre-trained image VL models2025.11 | 15.8 | 11.5 | 13.3 | |
| X-CLIPPre-trained=Kinetics-400, Evaluation Protocol=Base-to-novel generalization2024.04 | 14.2 | 11 | 12.4 | |
| ActionCLIPAdaptation Strategy=Adapting pre-trained image VL models2025.11 | 13.3 | 10.1 | 11.5 | |
| A5Pre-trained=Kinetics-400, Evaluation Protocol=Base-to-novel generalization2024.04 | 12.9 | 5.7 | 7.9 | |
| CLIP text-FTAdaptation Strategy=Tuning pre-trained image VL models2025.11 | 12.4 | 9.5 | 10.8 | |
| CLIP image-FTAdaptation Strategy=Tuning pre-trained image VL models2025.11 | 9.2 | 8.5 | 8.8 | |
| X-CLIPAdaptation Strategy=Adapting pre-trained image VL models2025.11 | 8.5 | 6.6 | 7.4 | |
| A5Adaptation Strategy=Adapting pre-trained image VL models2025.11 | 8.3 | 5.3 | 6.4 | |
| ActionCLIPPre-trained=Kinetics-400, Evaluation Protocol=Base-to-novel generalization2024.04 | 8.1 | 8.7 | 8.4 | |
| Vanilla CLIPAdaptation Strategy=Adapting pre-trained image VL models2025.11 | 4.9 | 5.3 | 5.1 |