Action Recognition on HMDB-51 (Accuracy)
92.5AccuracyVideo-STAR-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Video-STAR-7BProtocol=Cross-Dataset2026.03 | 92.5 | |
| Video-STAR-7BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 92.5 | |
| Video-STAR-7B2025.10 | 92.1 | |
| Video-STAR-3BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 86.2 | |
| InternVideo2Protocol=Fine-Tuned2026.03 | 80.7 | |
| Gemini-1.5-Pro2025.10 | 73.6 | |
| Qwen3-VL-8B2025.10 | 68.5 | |
| SimVAWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 62.2 | |
| SimVAWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 61.8 | |
| BDC-CLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 59.7 | |
| BDC-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 58.4 | |
| MoTEDWSE=false, Backbone Status=frozen, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 58.2 | |
| TC-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 56.8 | |
| InternVideo2Protocol=Zero-Shot2026.03 | 56.7 | |
| TC-CLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 56 | |
| STDDSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 55.9 | |
| STDDPublication=AAAI’25, Training Paradigm=Vision-Language Training2026.04 | 55.9 | |
| OSTWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 55.9 | |
| Motion-Guided Semantic Alignment with Negative PromptsPublication=Ours, Training Paradigm=Vision-Language Training2026.04 | 55.2 | |
| FROSTERSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 54.8 | |
| FROSTERWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 54.8 | |
| Open-MeDeSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 54.6 | |
| ZARPublication=EI’25, Training Paradigm=Vision-Language Training2026.04 | 54.2 | |
| TP-CLIPPublication=CVPR’25, Training Paradigm=Vision-Language Training2026.04 | 54.1 | |
| CLAVERPublication=ICLR’25, Training Paradigm=Vision-Language Training2026.04 | 54.1 | |
| Open-VCLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 53.9 | |
| GILPublication=ACCV’24, Training Paradigm=Vision-Language Training2026.04 | 53.9 | |
| Open-VCLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 53.9 | |
| Qwen2.5-VL-7BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 53.1 | |
| SDR-CLIPPublication=ACCV’24, Training Paradigm=Vision-Language Training2026.04 | 52.7 | |
| ViFi-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 52.3 | |
| MAXIWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 52.3 | |
| ViFi-CLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 52.2 | |
| ActionCLIPWSE=true, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 51.9 | |
| ViFi-CLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 51.3 | |
| ST-AdapterSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 51.1 | |
| ActionCLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 49.1 | |
| Vita-CLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 48.6 | |
| Vita-CLIPPublication=CVPR’23, Training Paradigm=Vision-Language Training2026.04 | 48.6 | |
| Vita-CLIPWSE=false, Backbone Status=frozen, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 48.6 | |
| ActionCLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 48.2 | |
| X-CLIPPublication=ECCV’22, Training Paradigm=Vision-Language Training2026.04 | 46.3 | |
| Qwen2.5-VL-7B2025.10 | 45.6 | |
| X-CLIPSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 44.6 | |
| X-CLIPWSE=false, Backbone Status=fine-tuned, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 44.6 | |
| A5Publication=ECCV’22, Training Paradigm=Vision-Language Training2026.04 | 44.3 | |
| A5WSE=false, Backbone Status=frozen, Setting=Zero-shot, Pre-train=Kinetics-4002026.05 | 44.3 | |
| Qwen2.5-VL-3BSetting=Three validation splits, Protocol=Cross-dataset2025.10 | 42.1 | |
| JigSawNetPublication=TIP’19, Training Paradigm=Vision Training2026.04 | 39.3 | |
| ER-ZSARPublication=ICCV’21, Training Paradigm=Vision Training2026.04 | 35.3 | |
| E2ETrain=K400, Open-vocabulary=true2024.03 | 32.7 | |
| OmniViDTrain=K400, Open-vocabulary=true2024.03 | 26.3 | |
| URTrain=K400, Open-vocabulary=true2024.03 | 24.4 | |
| ZSECOCTrain=K400, Open-vocabulary=true2024.03 | 22.6 | |
| ASRTrain=K400, Open-vocabulary=true2024.03 | 21.8 |