Video Recognition on UCF-101 (Zero-Shot)
79.7Top-1 AccOST
Evaluation Results
| Method | Links | |
|---|---|---|
| OSTVenue=CVPR’24, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 79.7 | |
| MAXIVenue=ICCV’23, Encoder=ViT-B/16, Frames=16 / 32, Inference=single-view2023.11 | 78.2 | |
| OSTVenue=CVPR’24, Encoder=ViT-B/16, Frames=8, Inference=single-view2023.11 | 77.9 | |
| ViFi-CLIPVenue=CVPR’23, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 76.8 | |
| Vita-CLIPVenue=CVPR’23, Encoder=ViT-B/16, Frames=8 / 32, Inference=single-view2023.11 | 75 | |
| DiSTVenue=ICCV’23, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 72.3 | |
| XCLIPVenue=ECCV’22, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 72 | |
| A5Venue=ECCV’22, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 69.3 | |
| Vanilla CLIPVenue=ICML’21, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 63.2 | |
| ActionCLIPVenue=arXiv’21, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 58.3 | |
| JigsawNetVenue=ECCV’22, Encoder=R(2+1)D, Frames=16, Inference=single-view2023.11 | 56 | |
| ER-ZSARVenue=ICCV’21, Encoder=TSM, Frames=16, Inference=single-view2023.11 | 51.8 |