Video Classification on UCF101 (3-split average)
98.6AccuracyPERF-Net
Evaluation Results
| Method | Links | |
|---|---|---|
| PERF-NetPretrain=ImageNet+K700, Modalities=RGB+Flow+Pose2022.08 | 98.6 | |
| SlowOnly-R101-RGB + I3D-FlowPretrain=OmniSource, Modalities=RGB+Flow2022.08 | 98.6 | |
| SMARTPretrain=ImageNet+K400, Modalities=RGB+Flow2022.08 | 98.6 | |
| EVL ViT-L/14@336pxPretrain=CLIP+K400, Modalities=RGB, Resolution=336px2022.08 | 98.6 | |
| EVL ViT-L/14Pretrain=CLIP+K400, Modalities=RGB, Resolution=224px2022.08 | 98.5 | |
| Two-Stream LGD-3DPretrain=ImageNet+K600, Modalities=RGB+Flow2022.08 | 98.2 | |
| I3DRGB+FlowBackbone=3D Inception2021.03 | 98 | |
| Two-Stream I3DPretrain=ImageNet+K400, Modalities=RGB+Flow2022.08 | 98 | |
| BQNBackbone=TSM R50, Inference Protocol=3 crops x 2 clips2021.03 | 97.6 | |
| SlowOnly-R101Pretrain=OmniSource, Modalities=RGB2022.08 | 97.3 | |
| LGD-3DPretrain=ImageNet+K600, Modalities=RGB2022.08 | 97 | |
| TEABackbone=R502021.03 | 96.9 | |
| FASTER32Pretrain=K400, Modalities=RGB2022.08 | 96.9 | |
| R(2+1)D-34Pretrain=K400, Modalities=RGB2022.08 | 96.8 | |
| S3DPretrain=ImageNet+K400, Modalities=RGB2022.08 | 96.8 | |
| PAN FullBackbone=TSM R502021.03 | 96.5 | |
| STMBackbone=R502021.03 | 96.2 | |
| TSMBackbone=R502021.03 | 95.9 | |
| STCPretrain=K400, Modalities=RGB2022.08 | 95.8 | |
| I3DPretrain=ImageNet+K400, Modalities=RGB2022.08 | 95.6 | |
| Dynamic Image Network2020.02 | 95.5 | |
| DI Four-StreamBackbone=ResNeXt1012021.03 | 95.5 | |
| Temporal Squeeze Network2020.02 | 95.2 | |
| TVNetBackbone=BNInception2021.03 | 94.5 | |
| TSNBackbone=BN-Inception2020.02 | 94.2 | |
| TSNRGB+FlowBackbone=BNInception2021.03 | 94 | |
| ECOPretrain=K400, Modalities=RGB2022.08 | 93.6 | |
| VideoPromptPretrain=CLIP, Modalities=RGB2022.08 | 93.6 | |
| Two-Stream Fusion+iDT2020.02 | 93.5 | |
| StNetBackbone=R502021.03 | 93.5 | |
| Two-Stream I3D2020.02 | 93.4 | |
| TDD+iDT2020.02 | 91.5 | |
| VGG16 + Images + IDT-FVbackbone=VGG16, training_data=video + web action images, motion_fusion=IDT-FV2015.12 | 91.1 | |
| VGG19 + Images + IDT-FVbackbone=VGG19, training_data=video + web action images, motion_fusion=IDT-FV2015.12 | 90.8 | |
| C3D+iDT+SVM2020.02 | 90.4 | |
| RCNN using LSTMtemporal_modeling=LSTM2015.12 | 88.6 | |
| Two-stream CNNinput=RGB + Optical Flow2015.12 | 88 | |
| Two-Streamfusion=SVM2020.02 | 88 | |
| iDT+HSV2020.02 | 87.9 | |
| IDT-FVfeature=Improved Dense Trajectories2015.12 | 85.9 | |
| iDT+Fisher vector2020.02 | 84.8 |