Video Action Recognition on HMDB51 (Top-1 Accuracy)
88.1Top-1 AccuracyVideoMAE V2
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoMAE V22025.09 | 88.1 | |
| OV-Encoder (Codec)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 85.3 | |
| OV-Encoder (Codec)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 83.4 | |
| OV-Encoder (Frame)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 83.1 | |
| MoTIFBackbone=PE-G/142025.09 | 83 | |
| AIMv2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 82.6 | |
| MoTIF-STBackbone=PE-G/142025.09 | 82.1 | |
| MoTIFBackbone=PE-L/142025.09 | 81.8 | |
| OV-Encoder (Frame)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 81.6 | |
| AIMv2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 81.3 | |
| SigLIP2Backbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 81.2 | |
| DINOv3Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 79.7 | |
| SigLIP2Backbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 79.1 | |
| SigLIPBackbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 78.8 | |
| DINOv3Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 78.6 | |
| MetaCLIP2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 78.2 | |
| CLIPBackbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 78 | |
| Global CBMBackbone=PE-G/14, Evaluation Protocol=Supervised2025.09 | 77.8 | |
| MetaCLIPBackbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 77.1 | |
| SigLIPBackbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 77 | |
| MetaCLIP2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 76.3 | |
| MoTIFBackbone=ViT-L/142025.09 | 76.1 | |
| TSM2025.09 | 73.5 | |
| NoFrame2025.09 | 73.4 | |
| OmniVLEvaluation Protocol=linear probing2022.09 | 70 | |
| FiTEvaluation Protocol=linear probing2022.09 | 68.8 | |
| ELoEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=S3D, Param=8.8M, Res=224, Frames=32, Modality=V+T2021.06 | 67.4 | |
| GDTEvaluation Protocol=Finetune, Pre-train Dataset=Audioset, Backbone=R(2+1)D, Param=14.4M, Res=224, Frames=32, Modality=V+A2021.06 | 66.1 | |
| GDTEvaluation Protocol=Finetune, Pretrain Dataset=Audioset, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=224, Frames=32, Modality=V+A2021.06 | 66.1 | |
| CVRLEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R3D-50, Param=36.1M, Res=224, Frames=16, Modality=V2021.06 | 65.4 | |
| CoCLR †Evaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 62.9 | |
| CoCLR †Evaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 62.9 | |
| ViCC-R+FEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 62.2 | |
| ViCC-R+FEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 62.2 | |
| ViCC-R+FEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=128, Frames=16, Modality=V2021.06 | 61.5 | |
| ViCC-R+FEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=128, Frames=16, Modality=V2021.06 | 61.5 | |
| MotionFitEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=32, Modality=V2021.06 | 61.4 | |
| MIL-NCEEvaluation Protocol=Finetune, Pre-train Dataset=HTM, Backbone=S3D, Param=8.8M, Res=224, Frames=32, Modality=V+T2021.06 | 61 | |
| MIL-NCEEvaluation Protocol=Finetune, Pretrain Dataset=HTM, Backbone=S3D, Number of Parameters=8.8M, Resolution=224, Frames=32, Modality=V+T2021.06 | 61 | |
| Zero-shotBackbone=PE-G/14, Evaluation Protocol=Zero-shot2025.09 | 60.7 | |
| TimeSformerPre-training=Sup21K, Evaluation Protocol=linear probing2022.09 | 60.1 | |
| CoCLR †Evaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 58.7 | |
| CoCLR †Evaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 58.7 | |
| AdaptFormer-64Avg. Params (M)=1.262022.05 | 55.69 | |
| ViCC-R+FEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=128, Frames=16, Modality=V2021.06 | 53.2 | |
| SeLaViEvaluation Protocol=Finetune, Pre-train Dataset=VGG-sound, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=30, Modality=V+A2021.06 | 53.1 | |
| MIL-NCEEvaluation Protocol=Linear, Pre-train Dataset=HTM, Backbone=S3D, Param=8.8M, Res=224, Frames=32, Modality=V+T2021.06 | 53.1 | |
| SeLaViEvaluation Protocol=Finetune, Pretrain Dataset=VGG-sound, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=30, Modality=V+A2021.06 | 53.1 | |
| MIL-NCEEvaluation Protocol=Linear, Pretrain Dataset=HTM, Backbone=S3D, Number of Parameters=8.8M, Resolution=224, Frames=32, Modality=V+T2021.06 | 53.1 | |
| VPTAvg. Params (M)=0.082022.05 | 52.67 | |
| XDCEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R(2+1)D, Param=14.4M, Res=224, Frames=32, Modality=V+A2021.06 | 52.6 | |
| Pace PredEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D-G, Param=9.6M, Res=224, Frames=64, Modality=V2021.06 | 52.6 | |
| XDCEvaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=224, Frames=32, Modality=V+A2021.06 | 52.6 | |
| Pace PredEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D-G, Number of Parameters=9.6M, Resolution=224, Frames=64, Modality=V2021.06 | 52.6 | |
| ViCC-RGBEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=128, Frames=16, Modality=V2021.06 | 52.4 | |
| CoCLR †Evaluation Protocol=Linear, Pre-train Dataset=K-400, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 52.4 | |
| ViCC-RGBEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=128, Frames=16, Modality=V2021.06 | 52.4 | |
| CoCLR †Evaluation Protocol=Linear, Pretrain Dataset=K-400, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 52.4 | |
| CoCLREvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 52.1 | |
| CoCLREvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 52.1 | |
| AdaptFormer-4Avg. Params (M)=0.152022.05 | 51.81 | |
| AdaptFormer-1Avg. Params (M)=0.102022.05 | 51.68 | |
| LinearAvg. Params (M)=0.072022.05 | 49.84 | |
| SpeedNetEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=S3D-G, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 48.8 | |
| SpeedNetEvaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=S3D-G, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 48.8 | |
| ViCC-RGBEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 47.9 | |
| ViCC-R+FEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 47.9 | |
| ViCC-RGBEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 47.9 | |
| ViCC-R+FEvaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 47.9 | |
| RTTEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=112, Frames=16, Modality=V2021.06 | 47.5 | |
| ViCC-R+FEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=128, Frames=16, Modality=V2021.06 | 46.7 | |
| Full-tuningAvg. Params (M)=86.042022.05 | 46.41 | |
| RTTEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 46.4 | |
| RTTEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=16, Modality=V2021.06 | 46.4 | |
| ViCC-R+FEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=128, Frames=16, Modality=V2021.06 | 45.2 | |
| ViCC-R+FEvaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=128, Frames=16, Modality=V2021.06 | 45.2 | |
| VIEEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R3D, Param=14.2M, Res=112, Frames=40, Modality=V2021.06 | 44.8 | |
| ViCC-RGBEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=128, Frames=16, Modality=V2021.06 | 44.7 | |
| CBTEvaluation Protocol=Finetune, Pre-train Dataset=K-600, Backbone=S3D, Param=8.8M, Res=112, Frames=16, Modality=V+T2021.06 | 44.6 | |
| CBTEvaluation Protocol=Finetune, Pretrain Dataset=K-600, Backbone=S3D, Number of Parameters=8.8M, Resolution=112, Frames=16, Modality=V+T2021.06 | 44.6 | |
| ViCC-RGBEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=128, Frames=16, Modality=V2021.06 | 44.2 | |
| CoCLR †Evaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 40.2 | |
| CoCLR †Evaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 40.2 | |
| CoCLREvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 39.1 | |
| CoCLREvaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 39.1 | |
| ViCC-RGBEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 38.5 | |
| ViCC-RGBEvaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 38.5 | |
| Var. PSPEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 36.8 | |
| Var. PSPEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=16, Modality=V2021.06 | 36.8 | |
| Pace PredEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 36.6 | |
| Pace PredEvaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=16, Modality=V2021.06 | 36.6 | |
| Pace PredEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 35.9 | |
| Pace PredEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=16, Modality=V2021.06 | 35.9 | |
| PRPEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 35 | |
| PRPEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=16, Modality=V2021.06 | 35 | |
| DPCEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R3D, Param=14.2M, Res=128, Frames=40, Modality=V2021.06 | 34.5 | |
| Var. PSPEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=112, Frames=16, Modality=V2021.06 | 33.7 | |
| RotNet3DEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R3D, Param=33.6M, Res=224, Frames=16, Modality=V2021.06 | 33.7 | |
| ST-PuzzleEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R3D, Param=33.6M, Res=224, Frames=16, Modality=V2021.06 | 33.7 | |
| VCPEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 32.2 |