Video Recognition on Kinetics-600 zero-shot
75.1Top-1 AccOST
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OSTVenue=CVPR’24, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 75.1 | 94.6 | |
| OSTVenue=CVPR’24, Encoder=ViT-B/16, Frames=8, Inference=single-view2023.11 | 73.9 | 94.1 | |
| MAXIVenue=ICCV’23, Encoder=ViT-B/16, Frames=16 / 32, Inference=single-view2023.11 | 71.5 | 92.5 | |
| ViFi-CLIPVenue=CVPR’23, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 71.2 | 92.2 | |
| Vita-CLIPVenue=CVPR’23, Encoder=ViT-B/16, Frames=8 / 32, Inference=single-view2023.11 | 67.4 | — | |
| ActionCLIPVenue=arXiv’21, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 66.7 | 91.6 | |
| XCLIPVenue=ECCV’22, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 65.2 | 86.1 | |
| Vanilla CLIPVenue=ICML’21, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 59.8 | 83.5 | |
| A5Venue=ECCV’22, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 55.8 | 81.4 | |
| ER-ZSARVenue=ICCV’21, Encoder=TSM, Frames=16, Inference=single-view2023.11 | 42.1 | 73.1 |