Zero-Shot Action Recognition on HMDB51 (test)
59AccuracyOpen-VCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| Open-VCLIPBackbone=ViT-L/14, Word Embeddings (WE)=true, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 59 | |
| TC-CLIPBackbone=ViT-L/14, Word Embeddings (WE)=true, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 57.1 | |
| TC-CLIPBackbone=ViT-L/14, Word Embeddings (WE)=false, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 56.1 | |
| ViFi-CLIP (reproduced)Backbone=ViT-L/14, Word Embeddings (WE)=true, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 55.8 | |
| ViFi-CLIPBackbone=ViT-L/14, Word Embeddings (WE)=false, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 55.6 | |
| Vita-CLIP B/16Training Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot, Mc=8, Mv=82023.04 | 48.6 | |
| X-CLIP-B/16Training Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot2023.04 | 44.6 | |
| A5Training Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot2023.04 | 44.3 | |
| ActionCLIPTraining Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot2023.04 | 40.8 | |
| ER-ZSARTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 35.3 | |
| E2ETraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 32.7 | |
| MTE + Full KLIEP + PPLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=true, Data augmentation=true2016.11 | 24.8 | |
| URTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 24.4 | |
| MTE + Full KLIEPLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=true, Data augmentation=false2016.11 | 23.9 | |
| TS-GCNTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 23.2 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=true, Data augmentation=true2016.11 | 22.8 | |
| ESZSLLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=true2016.11 | 22.7 | |
| ZSECOCTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 22.6 | |
| ASRTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 21.8 | |
| MTELabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 19.7 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=true, Data augmentation=false2016.11 | 19.3 | |
| ESZSLLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 18.5 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=false, Data augmentation=true2016.11 | 15.6 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=false, Data augmentation=false2016.11 | 14.9 | |
| SJELabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 13.3 |