Video Action Recognition on UCF101
99.6Top-1 AccVideoMAE V2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VideoMAE V22025.09 | 99.6 | — | |
| MoTIF-STBackbone=PE-G/142025.09 | 98.4 | — | |
| MoTIFBackbone=PE-G/142025.09 | 98 | — | |
| Global CBMBackbone=PE-G/14, Evaluation Protocol=Supervised2025.09 | 97.5 | — | |
| MoTIFBackbone=PE-L/142025.09 | 97 | — | |
| Ours ViT-Lshot=All2022.07 | 96.9 | — | |
| Ours ViT-Lshot=22022.07 | 96.6 | — | |
| Ours ViT-Lshot=12022.07 | 96.4 | — | |
| SMILEEvaluation Protocol=Finetuning, Intermediate Dataset=K400 [35]2025.04 | 96.4 | — | |
| NoFrame2025.09 | 96.4 | — | |
| UMTEvaluation Protocol=Finetuning, Intermediate Dataset=K700 [8]2025.04 | 96 | — | |
| TSM2025.09 | 95.9 | — | |
| ViCLIPEvaluation Protocol=Finetuning, Intermediate Dataset=Intervid-10M [84]2025.04 | 95.2 | — | |
| MoTIFBackbone=ViT-L/142025.09 | 94.8 | — | |
| ViFi-CLIPEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 94.6 | — | |
| ILAEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 94.2 | — | |
| AIMEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 94 | — | |
| ELoEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=S3D, Param=8.8M, Res=224, Frames=32, Modality=V+T2021.06 | 93.8 | — | |
| HR2G-shotBackbone=ResNet-based CLIP, Few-shot Setting=5-way 1-shot2025.04 | 93.7 | — | |
| CLIPEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 93.6 | — | |
| OmniVLEvaluation Protocol=linear probing2022.09 | 93.2 | — | |
| ViFi-CLIPK=16, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 92.7 | — | |
| GDTEvaluation Protocol=Finetune, Pre-train Dataset=Audioset, Backbone=R(2+1)D, Param=14.4M, Res=224, Frames=32, Modality=V+A2021.06 | 92.5 | — | |
| GDTEvaluation Protocol=Finetune, Pretrain Dataset=Audioset, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=224, Frames=32, Modality=V+A2021.06 | 92.5 | — | |
| MVP-shotBackbone=ResNet-based CLIP, Few-shot Setting=5-way 1-shot2025.04 | 92.2 | — | |
| CVRLEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R3D-50, Param=36.1M, Res=224, Frames=16, Modality=V2021.06 | 92.1 | — | |
| X-CLIPEvaluation Protocol=Finetuning, Intermediate Dataset=None2025.04 | 92 | — | |
| ActionCLIPK=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 91.4 | — | |
| XCLIPK=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 91.4 | — | |
| MIL-NCEEvaluation Protocol=Finetune, Pre-train Dataset=HTM, Backbone=S3D, Param=8.8M, Res=224, Frames=32, Modality=V+T2021.06 | 91.3 | — | |
| MIL-NCEEvaluation Protocol=Finetune, Pretrain Dataset=HTM, Backbone=S3D, Number of Parameters=8.8M, Resolution=224, Frames=32, Modality=V+T2021.06 | 91.3 | — | |
| CLIP-FSARBackbone=ResNet-based CLIP, Few-shot Setting=5-way 1-shot2025.04 | 91.3 | — | |
| CoCLR †Evaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 90.6 | — | |
| CoCLR †Evaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 90.6 | — | |
| CLIP image-FTK=16, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 90.5 | — | |
| ViCC-R+FEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 90.5 | — | |
| ViCC-R+FEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 90.5 | — | |
| ViFi-CLIPK=8, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 90 | — | |
| A5K=16, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 89.9 | — | |
| FiTEvaluation Protocol=linear probing2022.09 | 89.6 | — | |
| MotionFitEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=32, Modality=V2021.06 | 88.9 | — | |
| ViCC-R+FEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=128, Frames=16, Modality=V2021.06 | 88.8 | — | |
| ViCC-R+FEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=128, Frames=16, Modality=V2021.06 | 88.8 | — | |
| CLIP text-FTK=16, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 88.1 | — | |
| UMTEvaluation Protocol=Linear Probing, Intermediate Dataset=K700 [8]2025.04 | 88 | — | |
| SeLaViEvaluation Protocol=Finetune, Pre-train Dataset=VGG-sound, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=30, Modality=V+A2021.06 | 87.7 | — | |
| SeLaViEvaluation Protocol=Finetune, Pretrain Dataset=VGG-sound, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=30, Modality=V+A2021.06 | 87.7 | — | |
| CoCLR †Evaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 87.3 | — | |
| CoCLR †Evaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 87.3 | — | |
| Pace PredEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D-G, Param=9.6M, Res=224, Frames=64, Modality=V2021.06 | 87.1 | — | |
| Pace PredEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D-G, Number of Parameters=9.6M, Resolution=224, Frames=64, Modality=V2021.06 | 87.1 | — | |
| XDCEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R(2+1)D, Param=14.4M, Res=224, Frames=32, Modality=V+A2021.06 | 86.8 | — | |
| XDCEvaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=224, Frames=32, Modality=V+A2021.06 | 86.8 | — | |
| ViCLIPEvaluation Protocol=Linear Probing, Intermediate Dataset=Intervid-10M [84]2025.04 | 86.7 | — | |
| CLIP text-FTK=8, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 85.8 | — | |
| A5K=8, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 85.7 | — | |
| ViCC-R+FEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=128, Frames=16, Modality=V2021.06 | 85.7 | — | |
| MCNBackbone=R3D, Resolution=128, Pre-trained=UCF101, Fine-tuning=true2021.08 | 85.4 | — | |
| CLIP image-FTK=8, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 85.3 | — | |
| ViFi-CLIPK=4, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 85.1 | — | |
| MCNBackbone=R(2+1)D, Resolution=128, Pre-trained=UCF101, Fine-tuning=true2021.08 | 84.8 | — | |
| MemDPCEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R2D3D, Param=14.2M, Res=224, Frames=40, Modality=V2021.06 | 84.3 | — | |
| ViCC-RGBEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 84.3 | — | |
| ViCC-RGBEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 84.3 | — | |
| X-Florenceshot=22022.07 | 84 | — | |
| SMILEEvaluation Protocol=Linear Probing, Intermediate Dataset=K400 [35]2025.04 | 83.8 | — | |
| XCLIPK=8, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 83.7 | — | |
| iCaRL (IM)Buffer Size=20202025.12 | 83.53 | — | |
| TimeSformerPre-training=Sup21K, Evaluation Protocol=linear probing2022.09 | 82.9 | — | |
| CLIP text-FTK=4, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 82.8 | — | |
| ViCC-RGBEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=128, Frames=16, Modality=V2021.06 | 82.8 | — | |
| ViCC-RGBEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=128, Frames=16, Modality=V2021.06 | 82.8 | — | |
| MIL-NCEEvaluation Protocol=Linear, Pre-train Dataset=HTM, Backbone=S3D, Param=8.8M, Res=224, Frames=32, Modality=V+T2021.06 | 82.7 | — | |
| MIL-NCEEvaluation Protocol=Linear, Pretrain Dataset=HTM, Backbone=S3D, Number of Parameters=8.8M, Resolution=224, Frames=32, Modality=V+T2021.06 | 82.7 | — | |
| RTTEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 81.6 | — | |
| RTTEvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=112, Frames=16, Modality=V2021.06 | 81.6 | — | |
| CoCLRBackbone=S3D, Resolution=128, Pre-trained=UCF101, Fine-tuning=true2021.08 | 81.4 | — | |
| CoCLREvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 81.4 | — | |
| CoCLREvaluation Protocol=Finetune, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 81.4 | — | |
| SpeedNetEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=S3D-G, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 81.1 | — | |
| SpeedNetEvaluation Protocol=Finetune, Pretrain Dataset=K-400, Backbone=S3D-G, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 81.1 | — | |
| iCaRLBuffer Size=20202025.12 | 81.07 | — | |
| ViFi-CLIPK=2, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 80.7 | — | |
| CLIP text-FTK=2, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 80.1 | — | |
| A5K=4, Adaptation strategy=Adapting pre-trained image VL models2022.12 | 79.9 | — | |
| VideoPromptshot=52022.07 | 79.5 | — | |
| CBTEvaluation Protocol=Finetune, Pre-train Dataset=K-600, Backbone=S3D, Param=8.8M, Res=112, Frames=16, Modality=V+T2021.06 | 79.5 | — | |
| CBTEvaluation Protocol=Finetune, Pretrain Dataset=K-600, Backbone=S3D, Number of Parameters=8.8M, Resolution=112, Frames=16, Modality=V+T2021.06 | 79.5 | — | |
| iCaRL (IM)Buffer Size=10102025.12 | 79.11 | — | |
| CLIP image-FTK=4, Adaptation strategy=Tuning pre-trained image VL models2022.12 | 79.1 | — | |
| ViCC-R+FEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=R(2+1)D, Param=14.4M, Res=128, Frames=16, Modality=V2021.06 | 78.3 | — | |
| ViCC-R+FEvaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=R(2+1)D, Number of Parameters=14.4M, Resolution=128, Frames=16, Modality=V2021.06 | 78.3 | — | |
| ViCC-RGBEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=128, Frames=16, Modality=V2021.06 | 78.2 | — | |
| ViCC-R+FEvaluation Protocol=Linear, Pre-train Dataset=UCF101, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 78 | — | |
| ViCC-R+FEvaluation Protocol=Linear, Pretrain Dataset=UCF101, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 78 | — | |
| CoCLR †Evaluation Protocol=Linear, Pre-train Dataset=K-400, Backbone=S3D, Param=8.8M, Res=128, Frames=32, Modality=V2021.06 | 77.8 | — | |
| CoCLR †Evaluation Protocol=Linear, Pretrain Dataset=K-400, Backbone=S3D, Number of Parameters=8.8M, Resolution=128, Frames=32, Modality=V2021.06 | 77.8 | — | |
| CLIPEvaluation Protocol=Linear Probing, Intermediate Dataset=None2025.04 | 77.5 | — | |
| RTTEvaluation Protocol=Finetune, Pre-train Dataset=UCF101, Backbone=R3D, Param=14.2M, Res=112, Frames=16, Modality=V2021.06 | 77.3 | — | |
| Pace PredEvaluation Protocol=Finetune, Pre-train Dataset=K-400, Backbone=R(2+1)D, Param=14.4M, Res=112, Frames=16, Modality=V2021.06 | 77.1 | — |