Action Recognition on UCF101 (test)
99.2AccuracyDIST
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DISTShot=5-shot, Backbone=CLIP ViT-B, N-way=5-way, Evaluation Protocol=combined few-shot and zero-shot2026.02 | 99.2 | — | — | — | — | — | |
| CLIP-FSARShot=5-shot, Backbone=CLIP ViT-B, N-way=5-way, Evaluation Protocol=combined few-shot and zero-shot2026.02 | 99.1 | — | — | — | — | — | |
| PoseConv3DModality=RGB + Flow + Pose, Fusion=LateFusion, Pre-training=Kinetics4002021.04 | 98.8 | — | — | — | — | — | |
| SMARTBackbone=TSN+Kinetics2020.12 | 98.6 | — | — | — | — | — | |
| SMARTBackbone=TSN-Inception-V3 (24M), Training Dataset=K400, Training Years=0.07, Protocol=Fine-tuning2021.03 | 98.6 | — | — | — | — | — | |
| OmniSourceModality=RGB + Flow2021.04 | 98.6 | — | — | — | — | — | |
| DynaMotion + I3DBackbone=Inc v32020.12 | 98.4 | — | — | — | — | — | |
| DISTShot=1-shot, Backbone=CLIP ViT-B, N-way=5-way, Evaluation Protocol=combined few-shot and zero-shot2026.02 | 98.3 | — | — | — | — | — | |
| I3DBackbone=Inc v32020.12 | 98 | — | — | — | — | — | |
| KI-NetBackbone=Res-1522020.12 | 97.8 | — | — | — | — | — | |
| Prob-Distill+Flow I3D*Input frames=24, Backbone=I3D2019.04 | 97.4 | — | — | — | — | — | |
| SRTG r3d-101Backbone=r3d, Depth=1012020.06 | 97.325 | 99.557 | — | — | — | — | |
| TC-CLIPK (shots)=16, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 97.3 | — | — | — | — | — | |
| SRTG r(2+1)d-101Backbone=r(2+1)d, Depth=1012020.06 | 97.281 | 99.16 | — | — | — | — | |
| CLIP-FSARShot=1-shot, Backbone=CLIP ViT-B, N-way=5-way, Evaluation Protocol=combined few-shot and zero-shot2026.02 | 97 | — | — | — | — | — | |
| BraVeConfig=V+FA, Backbone=TSM-50x2 (93.9M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Fine-tuning2021.03 | 96.9 | — | — | — | — | — | |
| R(2+1)D-RGBFLOPs=152.4 G, +OF=false2018.07 | 96.8 | — | — | — | — | — | |
| AASBackbone=TSN+Kinetics2020.12 | 96.8 | — | — | — | — | — | |
| S3DBackbone=S3D (9.1M), Training Dataset=IN+K400, Training Years=0.07, Protocol=Fine-tuning2021.03 | 96.8 | — | — | — | — | — | |
| Qwen2.5-VL-7BSetting=1-shot, Label configuration=With labels (Semantic)2026.06 | 96.8 | — | — | — | — | — | |
| Two Stream I3D*Input frames=24, Backbone=I3D, Modality=Two Stream2019.04 | 96.7 | — | — | — | — | — | |
| TC-CLIPK (shots)=8, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 96.6 | — | — | — | — | — | |
| MMEBackbone=ViT-B, Pre-train=K4002022.10 | 96.5 | — | — | — | — | — | |
| VL PromptingK (shots)=16, Pre-trained=Kinetics-4002022.12 | 96.4 | — | — | — | — | — | |
| ViFi-CLIPK (shots)=16, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 96.4 | — | — | — | — | — | |
| DeCoDe (Qwen2.5-VL-7B)Setting=1-shot dec., Label configuration=With labels (Semantic)2026.06 | 96.4 | — | — | — | — | — | |
| ρBYOLBackbone=S3D (9.1M), Training Dataset=K400, Training Years=0.07, Training Modalities=V, Protocol=Fine-tuning2021.03 | 96.3 | — | — | — | — | — | |
| XCLIPK (shots)=16, Pre-trained=Kinetics-4002022.12 | 96.3 | — | — | — | — | — | |
| X-CLIPK (shots)=16, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 96.3 | — | — | — | — | — | |
| VideoMAEBackbone=ViT-B, Pre-train=K4002022.10 | 96.1 | — | — | — | — | — | |
| MF-NetFLOPs=11.1 G, +OF=false2018.07 | 96 | — | — | — | — | — | |
| Qwen2.5-VL-7BSetting=0-shot, Label configuration=With labels (Semantic)2026.06 | 95.9 | — | — | — | — | — | |
| SMARTBackbone=TSN2020.12 | 95.8 | — | — | — | — | — | |
| SF r3d-101Backbone=r3d, Depth=1012020.06 | 95.756 | 99.138 | — | — | — | — | |
| r3d-101Backbone=r3d, Depth=1012020.06 | 95.756 | 98.423 | — | — | — | — | |
| SRTG r3d-50Backbone=r3d, Depth=502020.06 | 95.756 | 98.55 | — | — | — | — | |
| Prob-DistillBackbone=RGB backbone2019.04 | 95.7 | — | — | — | — | — | |
| SRTG r(2+1)d-50Backbone=r(2+1)d, Depth=502020.06 | 95.675 | 98.842 | — | — | — | — | |
| I3D-RGBFLOPs=107.9 G, +OF=false2018.07 | 95.6 | — | — | — | — | — | |
| I3D-RGB*Pretraining Dataset=Kinetics + Imagenet, Pretraining Supervision=fully supervised (object+action labels), Source=as listed in [18]2018.06 | 95.6 | — | — | — | — | — | |
| Two Stream ResNeXtBackbone=ResNeXt, Modality=Two Stream2019.04 | 95.6 | — | — | — | — | — | |
| BraVeConfig=V+A, Backbone=TSM-50 (23.5M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Fine-tuning2021.03 | 95.6 | — | — | — | — | — | |
| BraVeConfig=V+FA, Backbone=TSM-50 (23.5M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Fine-tuning2021.03 | 95.6 | — | — | — | — | — | |
| TC-CLIPK (shots)=4, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 95.6 | — | — | — | — | — | |
| r(2+1)d-101Backbone=r(2+1)d, Depth=1012020.06 | 95.503 | 98.705 | — | — | — | — | |
| ρBYOLBackbone=R3D50 (31.8M), Training Dataset=K400, Training Years=0.07, Training Modalities=V, Protocol=Fine-tuning2021.03 | 95.5 | — | — | — | — | — | |
| XDCBackbone=R(2+1)D-18 (33.3M), Training Dataset=IG65M, Training Years=21, Training Modalities=VA, Protocol=Fine-tuning2021.03 | 95.5 | — | — | — | — | — | |
| BraVeConfig=V+F×3, Backbone=R3D50 (31.8M), Training Dataset=K600, Training Years=0.1, Training Modalities=VF, Protocol=Fine-tuning2021.03 | 95.4 | — | — | — | — | — | |
| BraVeConfig=V+F×3, Backbone=TSM-50 (23.5M), Training Dataset=K600, Training Years=0.1, Training Modalities=VF, Protocol=Fine-tuning2021.03 | 95.2 | — | — | — | — | — | |
| GDTBackbone=R(2+1)D, Pre-train=IG65M2022.10 | 95.2 | — | — | — | — | — | |
| I3D-RGB*Pretraining Dataset=Kinetics, Pretraining Supervision=fully supervised (action labels), Source=as listed in [18]2018.06 | 95.1 | — | — | — | — | — | |
| (2+1)D ResNet-50Supervision=Supervised, Pre-training=Kinetics2020.02 | 95.1 | — | — | — | — | — | |
| BraVeConfig=V+F×3, Backbone=R3D50 (31.8M), Training Dataset=K400, Training Years=0.07, Training Modalities=VF, Protocol=Fine-tuning2021.03 | 95.1 | — | — | — | — | — | |
| BraVeConfig=V+V×3, Backbone=R3D50 (31.8M), Training Dataset=K600, Training Years=0.1, Training Modalities=V, Protocol=Fine-tuning2021.03 | 95 | — | — | — | — | — | |
| BraVeConfig=V+FA, Backbone=R(2+1)D-50 (46.9M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Fine-tuning2021.03 | 95 | — | — | — | — | — | |
| VL PromptingK (shots)=8, Pre-trained=Kinetics-4002022.12 | 95 | — | — | — | — | — | |
| ViFi-CLIPK (shots)=8, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 95 | — | — | — | — | — | |
| TSNNumber of segments=72017.05 | 94.9 | — | — | — | — | — | |
| MARS+Flow ResNeXtBackbone=ResNeXt2019.04 | 94.9 | — | — | — | — | — | |
| I3D RGB*Input frames=24, Backbone=I3D, Modality=RGB2019.04 | 94.8 | — | — | — | — | — | |
| SRTG r3d-34Backbone=r3d, Depth=342020.06 | 94.799 | 98.064 | — | — | — | — | |
| ir-CSN-101Backbone=ir-CSN, Depth=1012020.06 | 94.708 | 98.681 | — | — | — | — | |
| BraVeConfig=V+V×3, Backbone=R3D50 (31.8M), Training Dataset=K400, Training Years=0.07, Training Modalities=V, Protocol=Fine-tuning2021.03 | 94.7 | — | — | — | — | — | |
| BraVeConfig=V+V×3, Backbone=TSM-50 (23.5M), Training Dataset=K600, Training Years=0.1, Training Modalities=V, Protocol=Fine-tuning2021.03 | 94.7 | — | — | — | — | — | |
| XCLIPK (shots)=8, Pre-trained=Kinetics-4002022.12 | 94.7 | — | — | — | — | — | |
| X-CLIPK (shots)=8, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 94.7 | — | — | — | — | — | |
| SF r3d-50Backbone=r3d, Depth=502020.06 | 94.619 | 98.756 | — | — | — | — | |
| MARS2019.04 | 94.6 | — | — | — | — | — | |
| AASBackbone=TSN2020.12 | 94.6 | — | — | — | — | — | |
| TVNet2019.04 | 94.5 | — | — | — | — | — | |
| ARTNetFLOPs=25.7 G, +OF=false2018.07 | 94.3 | — | — | — | — | — | |
| FeatMatch2019.04 | 94.3 | — | — | — | — | — | |
| TSNNumber of segments=32017.05 | 94.2 | — | — | — | — | — | |
| TSNFLOPs=3.8 G, +OF=true2018.07 | 94.2 | — | — | — | — | — | |
| TSNBackbone=BN-Inc2020.12 | 94.2 | — | — | — | — | — | |
| R(2+1)D-18Backbone=R(2+1)D-18 (33.3M), Training Dataset=K400, Training Years=0.07, Protocol=Fine-tuning2021.03 | 94.2 | — | — | — | — | — | |
| XDCBackbone=R(2+1)D, Pre-train=IG65M2022.10 | 94.2 | — | — | — | — | — | |
| ρBYOLBackbone=R50, Pre-train=K4002022.10 | 94.2 | — | — | — | — | — | |
| SRTG r(2+1)d-34Backbone=r(2+1)d, Depth=342020.06 | 94.149 | 97.814 | — | — | — | — | |
| Evolved LossSupervision=Weakly guided2020.02 | 94.1 | — | — | — | — | — | |
| TC-CLIPK (shots)=2, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 94.1 | — | — | — | — | — | |
| r(2+1)d-50Backbone=r(2+1)d, Depth=502020.06 | 93.923 | 97.843 | — | — | — | — | |
| MF-Net2020.06 | 93.863 | 98.372 | — | — | — | — | |
| ELoSupervision=Unsupervised2020.02 | 93.8 | — | — | — | — | — | |
| ELoBackbone=R(2+1)D-50 (46.9M), Training Dataset=YT8M, Training Years=13, Training Modalities=VFA, Protocol=Fine-tuning2021.03 | 93.8 | — | — | — | — | — | |
| VL PromptingK (shots)=4, Pre-trained=Kinetics-4002022.12 | 93.7 | — | — | — | — | — | |
| ViFi-CLIPK (shots)=4, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 93.7 | — | — | — | — | — | |
| BraVeConfig=V+A, Backbone=R(2+1)D-18 (33.3M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Fine-tuning2021.03 | 93.6 | — | — | — | — | — | |
| CORPBackbone=R50, Pre-train=K4002022.10 | 93.5 | — | — | — | — | — | |
| CVRLBackbone=R3D50 (31.8M), Training Dataset=K600, Training Years=0.1, Training Modalities=V, Protocol=Fine-tuning2021.03 | 93.4 | — | — | — | — | — | |
| BraVeConfig=V+FA, Backbone=TSM-50x2 (93.9M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Linear2021.03 | 93.2 | — | — | — | — | — | |
| r3d-50Backbone=r3d, Depth=502020.06 | 93.126 | 96.293 | — | — | — | — | |
| KVMF2017.05 | 93.1 | — | — | — | — | — | |
| BraVeConfig=V+F×3, Backbone=R3D50 (31.8M), Training Dataset=K600, Training Years=0.1, Training Modalities=VF, Protocol=Linear2021.03 | 93.1 | — | — | — | — | — | |
| XDCBackbone=R(2+1)D-18 (33.3M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Fine-tuning2021.03 | 93 | — | — | — | — | — | |
| BraVeConfig=V+A, Backbone=TSM-50 (23.5M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 93 | — | — | — | — | — | |
| A5K (shots)=16, Pre-trained=Kinetics-4002022.12 | 93 | — | — | — | — | — | |
| A5K (shots)=16, Pre-trained=Kinetics-400, Fine-tuning=true2024.04 | 93 | — | — | — | — | — | |
| PlainCompression Method=Uncompressed2026.05 | 92.92 | — | — | — | — | — | |
| LCVECompression Method=Uncompressed2026.05 | 92.92 | — | — | — | — | — |