Video Recognition on HMDB51
82.8AccuracyViT-L/14@336px w/ ST-Adapter
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ViT-L/14@336px w/ ST-AdapterPre-train data=CLIP+K4002022.06 | 82.8 | — | |
| ViT-L/14 w/ ST-AdapterPre-train data=CLIP+K4002022.06 | 81.7 | — | |
| SlowOnly-8x8-R101Pre-train data=Kinetics+OmniSource[19]2022.06 | 79 | — | |
| ViT-B/16 w/ ST-AdapterPre-train data=CLIP+K4002022.06 | 77.7 | — | |
| ST Swin w/ LSTCLPretraining dataset=K400 (Unsup.), Evaluation Protocol=Full fine-tuning2021.06 | 75.9 | — | |
| S3DPre-train data=ImageNet+K4002022.06 | 75.9 | — | |
| CLAdapterBackbone=Swin-B2025.12 | 75.8 | — | |
| FASTER32Pre-train data=K4002022.06 | 75.7 | — | |
| AMeFu-Netevaluation_protocol=5-way, shot=5-shot2020.10 | 75.5 | — | |
| pBYOLpre-train=K400, backbone=S3D-G, param=9.1M, T=32, mod=V, evaluation protocol=fine-tuning2021.04 | 75 | — | |
| pBYOLPretraining dataset=K400 (Unsup.), Evaluation Protocol=Full fine-tuning2021.06 | 75 | — | |
| I3DPre-train data=ImageNet+K4002022.06 | 74.8 | — | |
| BraVePretraining dataset=K400 (Unsup.), Evaluation Protocol=Full fine-tuning2021.06 | 74.6 | — | |
| R(2+1)D-34Pre-train data=K4002022.06 | 74.5 | — | |
| VidPrism-CEvaluation Protocol=Tuning, Shot Count (K)=16, Backbone=CLIP2026.05 | 74.1 | — | |
| pBYOLpre-train=K400, backbone=R-50, param=31.8M, T=16, mod=V, evaluation protocol=fine-tuning2021.04 | 73.6 | — | |
| VideoMAE2025.12 | 73.3 | — | |
| VidPrism-MEvaluation Protocol=Tuning, Shot Count (K)=16, Backbone=VideoMAEv22026.05 | 73.2 | — | |
| STCPre-train data=K4002022.06 | 72.6 | — | |
| pBYOLpre-train=K400, backbone=R(2+1)D-18, param=15.4M, T=32, mod=V, evaluation protocol=fine-tuning2021.04 | 72.2 | — | |
| VideoMAEv2Evaluation Protocol=Tuning, Shot Count (K)=162026.05 | 72.2 | — | |
| pBYOLpre-train=K400, backbone=R-50, param=31.8M, T=8, mod=V, evaluation protocol=fine-tuning2021.04 | 72.1 | — | |
| ρBYOLρ = 42025.12 | 72.1 | — | |
| AMeFu-Netevaluation_protocol=5-way, shot=3-shot2020.10 | 71.5 | — | |
| CVRL2025.12 | 70.6 | — | |
| ETLEvaluation Protocol=Adapting, Shot Count (K)=162026.05 | 70.4 | — | |
| ViCLIPEvaluation Protocol=Tuning, Shot Count (K)=162026.05 | 70.3 | — | |
| MMVpre-train=AS+HT, backbone=S3D-G, param=9.1M, T=32, mod=V+A+T, evaluation protocol=fine-tuning2021.04 | 69.6 | — | |
| ECOPre-train data=K4002022.06 | 68.4 | — | |
| VidPrism-MEvaluation Protocol=Tuning, Shot Count (K)=8, Backbone=VideoMAEv22026.05 | 68.3 | — | |
| RGB Basenet++evaluation_protocol=5-way, shot=5-shot2020.10 | 68.2 | — | |
| MoTEEvaluation Protocol=Tuning, Shot Count (K)=162026.05 | 68.2 | — | |
| CORPf2025.12 | 68 | — | |
| RGB Basenetevaluation_protocol=5-way, shot=5-shot2020.10 | 67.8 | — | |
| VidPrism-CEvaluation Protocol=Tuning, Shot Count (K)=8, Backbone=CLIP2026.05 | 67.6 | — | |
| OSTEvaluation Protocol=Tuning, Shot Count (K)=162026.05 | 67.3 | — | |
| MoTEEvaluation Protocol=Tuning, Shot Count (K)=82026.05 | 67.2 | — | |
| ETLEvaluation Protocol=Adapting, Shot Count (K)=82026.05 | 67.1 | — | |
| ViFi-CLIPEvaluation Protocol=Adapting, Shot Count (K)=162026.05 | 66.8 | — | |
| CVRLpre-train=K400, backbone=R-50, param=31.8M, T=32, mod=V, evaluation protocol=fine-tuning2021.04 | 66.7 | — | |
| MAXIEvaluation Protocol=Tuning, Shot Count (K)=162026.05 | 66.5 | — | |
| VideoPromptPre-train data=CLIP2022.06 | 66.4 | — | |
| OSTEvaluation Protocol=Tuning, Shot Count (K)=82026.05 | 65.6 | — | |
| MAXIEvaluation Protocol=Tuning, Shot Count (K)=82026.05 | 65 | — | |
| RSPNet2025.12 | 64.7 | — | |
| ViFi-CLIPEvaluation Protocol=Adapting, Shot Count (K)=82026.05 | 64.5 | — | |
| ViCLIPEvaluation Protocol=Tuning, Shot Count (K)=82026.05 | 64.5 | — | |
| VidPrism-CEvaluation Protocol=Tuning, Shot Count (K)=4, Backbone=CLIP2026.05 | 64.1 | — | |
| ADMM-based TT-formatComp. Method=TT, # Para.=0.20M, Comp. Ratio=84.0x2021.07 | 64.09 | — | |
| X-CLIPEvaluation Protocol=Adapting, Shot Count (K)=162026.05 | 64 | — | |
| MoTEEvaluation Protocol=Tuning, Shot Count (K)=42026.05 | 63.9 | — | |
| TR-LSTMComp. Method=TR, # Para.=0.67M, Comp. Ratio=25.0x2021.07 | 63.8 | — | |
| VidPrism-MEvaluation Protocol=Tuning, Shot Count (K)=4, Backbone=VideoMAEv22026.05 | 63.3 | — | |
| ActionCLIPEvaluation Protocol=Adapting, Shot Count (K)=162026.05 | 63.2 | — | |
| VideoMAEv2Evaluation Protocol=Tuning, Shot Count (K)=82026.05 | 63.2 | — | |
| RGB Basenet++evaluation_protocol=5-way, shot=3-shot2020.10 | 63 | — | |
| CoCLRpre-train=K400, backbone=2xS3D-G, param=9.1M, T=32, mod=V, evaluation protocol=fine-tuning2021.04 | 62.9 | — | |
| UncompressedComp. Method=-, # Para.=16.8M, Comp. Ratio=1.0x2021.07 | 62.9 | — | |
| X-CLIPEvaluation Protocol=Adapting, Shot Count (K)=82026.05 | 62.8 | — | |
| ViFi-CLIPEvaluation Protocol=Adapting, Shot Count (K)=42026.05 | 62.7 | — | |
| OSTEvaluation Protocol=Tuning, Shot Count (K)=42026.05 | 62.5 | — | |
| RGB Basenetevaluation_protocol=5-way, shot=3-shot2020.10 | 62.4 | — | |
| A5Evaluation Protocol=Adapting, Shot Count (K)=162026.05 | 62.4 | — | |
| ETLEvaluation Protocol=Adapting, Shot Count (K)=42026.05 | 62.3 | — | |
| TT-LSTMComp. Method=TT, # Para.=0.67M, Comp. Ratio=25.0x2021.07 | 62.24 | — | |
| MoTEEvaluation Protocol=Tuning, Shot Count (K)=22026.05 | 61.3 | — | |
| ST SwinPretraining dataset=K400 (Superv.), Evaluation Protocol=Full fine-tuning2021.06 | 61.2 | — | |
| ETLEvaluation Protocol=Adapting, Shot Count (K)=22026.05 | 61.2 | — | |
| ARNevaluation_protocol=5-way, shot=5-shot2020.10 | 60.6 | — | |
| ViCLIPEvaluation Protocol=Tuning, Shot Count (K)=42026.05 | 60.4 | — | |
| AMeFu-Netevaluation_protocol=5-way, shot=1-shot2020.10 | 60.2 | — | |
| MAXIEvaluation Protocol=Tuning, Shot Count (K)=42026.05 | 60.1 | — | |
| PSTRN-SComp. Method=TR, # Para.=0.48M, Comp. Ratio=34.7x2021.07 | 60.04 | — | |
| GDTpre-train=K400, backbone=R(2+1)D-18, param=15.4M, T=32, mod=V+A, evaluation protocol=fine-tuning2021.04 | 60 | — | |
| OSTEvaluation Protocol=Tuning, Shot Count (K)=22026.05 | 60 | — | |
| PSTRN-MComp. Method=TR, # Para.=0.36M, Comp. Ratio=46.7x2021.07 | 59.67 | — | |
| MAXIEvaluation Protocol=Tuning, Shot Count (K)=22026.05 | 58 | — | |
| ActionCLIPEvaluation Protocol=Adapting, Shot Count (K)=42026.05 | 57.9 | — | |
| ActionCLIPEvaluation Protocol=Adapting, Shot Count (K)=82026.05 | 57.7 | — | |
| X-CLIPEvaluation Protocol=Adapting, Shot Count (K)=42026.05 | 57.3 | — | |
| ViFi-CLIPEvaluation Protocol=Adapting, Shot Count (K)=22026.05 | 57.2 | — | |
| A5Evaluation Protocol=Adapting, Shot Count (K)=82026.05 | 56 | — | |
| Vi²CLR2025.12 | 55.7 | — | |
| VidPrism-CEvaluation Protocol=Tuning, Shot Count (K)=2, Backbone=CLIP2026.05 | 55 | — | |
| CoCLRpre-train=K400, backbone=S3D-G, param=9.1M, T=32, mod=V, evaluation protocol=fine-tuning2021.04 | 54.6 | — | |
| CoCLR2025.12 | 54.6 | — | |
| MemDPC2025.12 | 54.5 | — | |
| ViCLIPEvaluation Protocol=Tuning, Shot Count (K)=22026.05 | 53.7 | — | |
| VidPrism-MEvaluation Protocol=Tuning, Shot Count (K)=2, Backbone=VideoMAEv22026.05 | 53.4 | — | |
| X-CLIPEvaluation Protocol=Adapting, Shot Count (K)=22026.05 | 53 | — | |
| VideoMAEv2Evaluation Protocol=Tuning, Shot Count (K)=42026.05 | 52.3 | — | |
| A5Evaluation Protocol=Adapting, Shot Count (K)=42026.05 | 50.7 | — | |
| RTTPre-train=K400, ClipSize=16 x 112^2, Network=R3D-182020.10 | 49.8 | — | |
| RGB Basenet++evaluation_protocol=5-way, shot=1-shot2020.10 | 49.3 | — | |
| VTHCLpre-train=K400, backbone=R-50, param=31.8M, T=8, mod=V, evaluation protocol=fine-tuning2021.04 | 49.2 | — | |
| VideoMoCo2025.12 | 49.2 | — | |
| RGB Basenetevaluation_protocol=5-way, shot=1-shot2020.10 | 48.8 | — | |
| SpeedNetPre-train=K400, ClipSize=64 x 224^2, Network=S3D-G2020.10 | 48.8 | — | |
| PCL (VCP)Pre-train=UCF, ClipSize=16 x 112^2, Network=R3D-182020.10 | 48.8 | — | |
| SpeedNetpre-train=K400, backbone=S3D-G, param=9.1M, T=64, mod=V, evaluation protocol=fine-tuning2021.04 | 48.8 | — |