Video Classification on UCF101 (averaged over three splits)
98.7AccuracySCT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| SCT-LPretrain=K4002021.08 | 98.7 | |
| SCT-MPretrain=K4002021.08 | 98.5 | |
| SCT-SPretrain=K4002021.08 | 98.3 | |
| SCT-SPretrain=ImageNet2021.08 | 98 | |
| Two-Stream I3D [11]Pre-trained=Imagenet+Kinetics 4002026.01 | 98 | |
| SCT-LPretrain=ImageNet2021.08 | 97.7 | |
| LGD-3DPretrain=K6002021.08 | 97 | |
| R(2+1)D-RGBBackbone=ResNet-34, FLOPS=152.4 G2018.10 | 96.8 | |
| R(2+1)DPretrain=K4002021.08 | 96.8 | |
| S3D-GPretrain=K4002021.08 | 96.8 | |
| A2-NetBackbone=ResNet-50, FLOPS=41.6 G2018.10 | 96.4 | |
| OFF [14]2026.01 | 96 | |
| I3D-RGBBackbone=Inception, FLOPS=107.9 G2018.10 | 95.6 | |
| I3DPretrain=K4002021.08 | 95.4 | |
| ST-ResNet + IDT [33]2026.01 | 94.6 | |
| ResNeXtPretrain=K4002021.08 | 94.5 | |
| Three-Stream TSN [20]2026.01 | 94.2 | |
| Two-Stream TSN [20]2026.01 | 94 | |
| Our (MViTv2-S based)Pre-trained=Kinetics-4002026.01 | 93.54 | |
| Two-Stream CNNs [12]Pre-trained=ImageNet2026.01 | 93.5 | |
| Two-Stream I3D [11]2026.01 | 93.4 | |
| MViTv2-S finetune (our baseline) [5]Pre-trained=Kinetics-4002026.01 | 92.11 | |
| LTC+iDT [32]2026.01 | 91.7 | |
| TDD+iDT [31]2026.01 | 91.5 | |
| Two-Stream C3D [13]2026.01 | 91.4 | |
| MViTv1-B finetune (our baseline)[4]Pre-trained=Kinetics-4002026.01 | 89.66 | |
| Two-Stream+LSTM [15]2026.01 | 88.6 | |
| Two-Stream CNNs [18]Pre-trained=ImageNet2026.01 | 88 | |
| Res3DBackbone=ResNet-18, FLOPS=19.3 G2018.10 | 85.8 | |
| VGG16 + ImagesBackbone=VGG16, Training data=Videos + Images, Fusion strategy=SVM fusion, Feature layer=fc72015.12 | 83.5 | |
| VGG19 + ImagesBackbone=VGG19, Training data=Videos + Images, Fusion strategy=SVM fusion, Feature layer=fc72015.12 | 83.4 | |
| VGG19 + ImagesBackbone=VGG19, Training data=Videos + Images, Fusion strategy=Voting2015.12 | 83.3 | |
| Swin-S finetune (our baseline)[26]Pre-trained=Kinetics-4002026.01 | 82.64 | |
| VGG16 + ImagesBackbone=VGG16, Training data=Videos + Images, Fusion strategy=Voting2015.12 | 82.5 | |
| C3DBackbone=VGG, FLOPS=38.5 G2018.10 | 82.3 | |
| VGG16Backbone=VGG16, Training data=Videos, Fusion strategy=Voting2015.12 | 77.9 | |
| VGG19Backbone=VGG19, Training data=Videos, Fusion strategy=Voting2015.12 | 77.8 | |
| spatial CNNBackbone=spatial CNN, Training data=Videos2015.12 | 73 | |
| slow fusion CNNBackbone=slow fusion CNN, Training data=Videos2015.12 | 65.4 |