Action Recognition on UCF101 (train-test)
99.6Top-1 AccuracyVideoMAE V2
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoMAE V2Evaluation Protocol=Non-interpretable2025.09 | 99.6 | |
| MoTIF-STBackbone=PE-G/142025.09 | 98.4 | |
| MoTIFBackbone=PE-G/142025.09 | 98 | |
| MoTIFBackbone=PE-G/142025.09 | 98 | |
| PE-G/14Evaluation Protocol=Global CBM, Backbone=G/142025.09 | 97.5 | |
| MoTIF-STBackbone=PE-L/142025.09 | 97.2 | |
| MoTIFBackbone=PE-L/142025.09 | 97 | |
| No frame left behindEvaluation Protocol=Non-interpretable2025.09 | 96.4 | |
| PE-L/14Evaluation Protocol=Global CBM, Backbone=L/142025.09 | 96.3 | |
| TSMEvaluation Protocol=Non-interpretable2025.09 | 95.9 | |
| MoTIFBackbone=ViT-L/142025.09 | 94.8 | |
| MoTIF-STBackbone=ViT-L/142025.09 | 94.8 | |
| MoTIFBackbone=PE-L/142025.09 | 94.8 | |
| CLIP-ViT-L/14Evaluation Protocol=Global CBM, Backbone=ViT-L/142025.09 | 93.4 | |
| MoTIFBackbone=ViT-B/322025.09 | 88.5 | |
| MoTIFBackbone=ViT-B/322025.09 | 88.5 | |
| DANCEBackbone=Baseline w/o interp.2025.09 | 88.4 | |
| DANCEBackbone=DANCE2025.09 | 87.5 | |
| MoTIFBackbone=RN/502025.09 | 86.7 | |
| CLIP-ViT-B/32Evaluation Protocol=Global CBM, Backbone=ViT-B/322025.09 | 86.4 | |
| LF-CBMBackbone=Disentangled concepts2025.09 | 85.5 | |
| CLIP-RN/50Evaluation Protocol=Global CBM, Backbone=RN/502025.09 | 84.1 | |
| PE-L/14Evaluation Protocol=Zero-shot, Backbone=L/142025.09 | 74.6 | |
| PE-G/14Evaluation Protocol=Zero-shot, Backbone=G/142025.09 | 74.6 | |
| CLIP-ViT-L/14Evaluation Protocol=Zero-shot, Backbone=ViT-L/142025.09 | 70.6 | |
| CLIP-ViT-B/32Evaluation Protocol=Zero-shot, Backbone=ViT-B/322025.09 | 59.9 | |
| CLIP-RN/50Evaluation Protocol=Zero-shot, Backbone=RN/502025.09 | 57.2 |