Video Classification on UCF-101 (test)
98.1Top-1 AccUniFormer
Evaluation Results
| Method | Links | |
|---|---|---|
| UniFormerPretrain=IN1K+K400, Backbone=UniFormer-S2022.01 | 98.1 | |
| I3Duse 3D-Conv=true2019.08 | 98 | |
| TDNPretrain=IN1K+K400, Backbone=ResNet502022.01 | 97.4 | |
| TEAPretrain=IN1K+K400, Backbone=ResNet502022.01 | 96.9 | |
| R(2+1)DPretrain=K400, Backbone=ResNet342022.01 | 96.8 | |
| VidTrPretrain=IN21K+K400, Backbone=ViT-B2022.01 | 96.6 | |
| CMA_iter1-Suse 3D-Conv=false2019.08 | 96.5 | |
| STMPretrain=IN1K+K400, Backbone=ResNet502022.01 | 96.2 | |
| CT-NetPretrain=IN1K+K400, Backbone=ResNet502022.01 | 96.2 | |
| I3DPretrain=IN1K+K400, Backbone=InceptionV22022.01 | 95.8 | |
| ResNet50-Suse 3D-Conv=false2019.08 | 95.5 | |
| CMA_iter1-Ruse 3D-Conv=false2019.08 | 95.3 | |
| ECOuse 3D-Conv=true2019.08 | 94.8 | |
| Attention Clusteruse 3D-Conv=false2019.08 | 94.6 | |
| TSMPretrain=IN1K+K400, Backbone=ResNet502022.01 | 94.5 | |
| ARTNetuse 3D-Conv=true2019.08 | 94.3 | |
| TSNuse 3D-Conv=false2019.08 | 94 | |
| ResNet50-Fuse 3D-Conv=false2019.08 | 92.4 | |
| TSNPretrain=IN1K+K400, Backbone=InceptionV22022.01 | 91.1 | |
| ResNet50-Ruse 3D-Conv=false2019.08 | 90.9 | |
| Two-streamuse 3D-Conv=false2019.08 | 88 | |
| C3DPretrain=Sports-1M, Backbone=ResNet182022.01 | 85.8 | |
| EVA-02-CLIPZero-shot=true, Backbone=ViT-E/14+, Training Scale=Enlarged2023.03 | 83.1 | |
| EVA-02-CLIPZero-shot=true, Backbone=ViT-E/14, Training Scale=Enlarged2023.03 | 82.8 | |
| Open CLIPZero-shot=true, Backbone=ViT-G/14, Training Scale=Enlarged2023.03 | 80.5 | |
| EVA-01-CLIPZero-shot=true, Backbone=ViT-g/14+, Training Scale=Enlarged2023.03 | 78.9 | |
| EVA-02-CLIPZero-shot=true, Backbone=ViT-L/14+, Training Scale=Enlarged2023.03 | 78.6 | |
| Open CLIP-Hzero-shot evaluation protocol=True2022.11 | 78.2 | |
| Open CLIPZero-shot=true, Backbone=ViT-H/14, Training Scale=Enlarged2023.03 | 78.2 | |
| OpenAI CLIPZero-shot=true, Backbone=ViT-L/14+, Training Scale=Enlarged2023.03 | 78.1 | |
| Open CLIPZero-shot=true, Backbone=ViT-g/14, Training Scale=Enlarged2023.03 | 77.8 | |
| Open CLIP-gzero-shot evaluation protocol=True2022.11 | 77.7 | |
| EVA-02-CLIPZero-shot=true, Backbone=ViT-L/14, Training Scale=Standard2023.03 | 76.8 | |
| OpenAI CLIP-Lzero-shot evaluation protocol=True2022.11 | 76.4 | |
| OpenAI CLIPZero-shot=true, Backbone=ViT-L/14, Training Scale=Standard2023.03 | 76.4 | |
| EVA CLIP-gzero-shot evaluation protocol=True2022.11 | 76.1 | |
| EVA-01-CLIPZero-shot=true, Backbone=ViT-g/14, Training Scale=Enlarged2023.03 | 76 | |
| Open CLIPZero-shot=true, Backbone=ViT-L/14, Training Scale=Standard2023.03 | 73.2 | |
| EVA-02-CLIPZero-shot=true, Backbone=ViT-B/16, Training Scale=Standard2023.03 | 68.6 | |
| Open CLIPZero-shot=true, Backbone=ViT-B/16, Training Scale=Standard2023.03 | 67.5 | |
| OpenAI CLIPZero-shot=true, Backbone=ViT-B/16, Training Scale=Standard2023.03 | 67.1 |