Video Recognition on HMDB-51 (zero-shot)
55.9Top-1 AccOST
Evaluation Results
| Method | Links | |
|---|---|---|
| OSTVenue=CVPR’24, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 55.9 | |
| DiSTVenue=ICCV’23, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 55.4 | |
| OSTVenue=CVPR’24, Encoder=ViT-B/16, Frames=8, Inference=single-view2023.11 | 54.9 | |
| MAXIVenue=ICCV’23, Encoder=ViT-B/16, Frames=16 / 32, Inference=single-view2023.11 | 52.3 | |
| ViFi-CLIPVenue=CVPR’23, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 51.3 | |
| Vita-CLIPVenue=CVPR’23, Encoder=ViT-B/16, Frames=8 / 32, Inference=single-view2023.11 | 48.6 | |
| XCLIPVenue=ECCV’22, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 44.6 | |
| A5Venue=ECCV’22, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 44.3 | |
| Vanilla CLIPVenue=ICML’21, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 40.8 | |
| ActionCLIPVenue=arXiv’21, Encoder=ViT-B/16, Frames=32, Inference=single-view2023.11 | 40.8 | |
| JigsawNetVenue=ECCV’22, Encoder=R(2+1)D, Frames=16, Inference=single-view2023.11 | 38.7 | |
| ER-ZSARVenue=ICCV’21, Encoder=TSM, Frames=16, Inference=single-view2023.11 | 35.3 |