Action Recognition on UCF-101 (Accuracy)
99.7AccuracyVideo-STAR-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Video-STAR-7B2025.10 | 99.7 | |
| GA2-CLIPK=16, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 95.5 | |
| ViLT-CLIPK=16, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 93.8 | |
| GA2-CLIPK=8, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 93.8 | |
| Gemini-1.5-Pro2025.10 | 93.3 | |
| ViFi-CLIPK=16, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 93.1 | |
| ViFi-CLIPK=16, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 92.7 | |
| GA2-CLIPK=4, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 91.8 | |
| ActionCLIPK=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 91.4 | |
| X-CLIPK=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 91.4 | |
| ViLT-CLIPK=8, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 91.3 | |
| CLIP image-FTK=16, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 90.5 | |
| ViFi-CLIPK=8, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 90.4 | |
| ViFi-CLIPK=8, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 90 | |
| ViLT-CLIPK=4, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 90 | |
| GA2-CLIPK=2, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 90 | |
| A5K=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 89.9 | |
| InternVideo2_clip-6B#F=8, Training Data=IV-400M, protocol=Zero-shot2024.03 | 89.5 | |
| InternVideo2_clip-1B#F=8, Training Data=IV-25.5M, protocol=Zero-shot2024.03 | 88.8 | |
| CLIP text-FTK=16, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 88.1 | |
| ViFi-CLIPK=4, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 87.1 | |
| Qwen3-VL-8B2025.10 | 87.1 | |
| CLIP text-FTK=8, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 85.8 | |
| A5K=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 85.7 | |
| CLIP image-FTK=8, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 85.3 | |
| ViLT-CLIPK=2, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 85.3 | |
| STDDPublication=AAAI’25, Training Paradigm=Vision-Language Training2026.04 | 85.2 | |
| ViFi-CLIPK=4, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 85.1 | |
| ViFi-CLIPK=2, Adaptation Protocol=Prompt tuning pre-trained image VL models2025.11 | 84 | |
| X-CLIPK=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 83.7 | |
| Qwen2.5-VL-7B2025.10 | 83.7 | |
| CLIP text-FTK=4, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 82.8 | |
| Motion-Guided Semantic Alignment with Negative PromptsPublication=Ours, Training Paradigm=Vision-Language Training2026.04 | 82.2 | |
| TP-CLIPPublication=CVPR’25, Training Paradigm=Vision-Language Training2026.04 | 81.1 | |
| ViFi-CLIPK=2, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 80.7 | |
| CLIP text-FTK=2, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 80.1 | |
| A5K=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 79.9 | |
| GILPublication=ACCV’24, Training Paradigm=Vision-Language Training2026.04 | 79.4 | |
| CLIP image-FTK=4, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 79.1 | |
| CLAVERPublication=ICLR’25, Training Paradigm=Vision-Language Training2026.04 | 78.6 | |
| TVTSv2#F=12, Training Data=V-8.5M, protocol=Zero-shot2024.03 | 78 | |
| ZARPublication=EI’25, Training Paradigm=Vision-Language Training2026.04 | 77.4 | |
| X-CLIPK=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 75.6 | |
| SDR-CLIPPublication=ACCV’24, Training Paradigm=Vision-Language Training2026.04 | 75.3 | |
| Vita-CLIPPublication=CVPR’23, Training Paradigm=Vision-Language Training2026.04 | 75 | |
| CLIP image-FTK=2, Adaptation Protocol=Tuning pre-trained image VL models2025.11 | 74.4 | |
| ActionCLIPK=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 73 | |
| ActionCLIPK=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 71.5 | |
| A5K=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 71.4 | |
| ActionCLIPK=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 70.6 | |
| X-CLIPPublication=ECCV’22, Training Paradigm=Vision-Language Training2026.04 | 70.3 | |
| A5Publication=ECCV’22, Training Paradigm=Vision-Language Training2026.04 | 69.3 | |
| CLIP#F=12, Training Data=I-400M, protocol=Zero-shot2024.03 | 68.9 | |
| Vanilla CLIPK=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 63.6 | |
| Vanilla CLIPK=4, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 63.6 | |
| Vanilla CLIPK=8, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 63.6 | |
| Vanilla CLIPK=16, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 63.6 | |
| JigSawNetPublication=TIP’19, Training Paradigm=Vision Training2026.04 | 56.8 | |
| ER-ZSARPublication=ICCV’21, Training Paradigm=Vision Training2026.04 | 51.8 | |
| X-CLIPK=2, Adaptation Protocol=Adapting pre-trained image VL models2025.11 | 48.5 |