Zero-Shot Action Recognition on UCF101 (test)
88.9AccuracyTC-CLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| TC-CLIPBackbone=ViT-L/14, Word Embeddings (WE)=true, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 88.9 | |
| ViFi-CLIP (reproduced)Backbone=ViT-L/14, Word Embeddings (WE)=true, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 88.1 | |
| Open-VCLIPBackbone=ViT-L/14, Word Embeddings (WE)=true, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 87.6 | |
| TC-CLIPBackbone=ViT-L/14, Word Embeddings (WE)=false, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 86.9 | |
| ViFi-CLIPBackbone=ViT-L/14, Word Embeddings (WE)=false, Evaluation protocol=Zero-shot, Training dataset=Kinetics-4002024.04 | 86.1 | |
| Vita-CLIP B/16Training Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot, Mc=8, Mv=82023.04 | 75 | |
| X-CLIP-B/16Training Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot2023.04 | 72 | |
| A5Training Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot2023.04 | 69.3 | |
| ActionCLIPTraining Paradigm=Vision-Language Training, Evaluation Protocol=Zero-shot2023.04 | 58.3 | |
| ER-ZSARTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 51.8 | |
| E2ETraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 48 | |
| TS-GCNTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 34.2 | |
| ASRTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 24.4 | |
| MTE + Full KLIEP + PPLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=true, Data augmentation=true2016.11 | 22.9 | |
| MTE + Full KLIEPLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=true, Data augmentation=false2016.11 | 21.9 | |
| ESZSLLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=true2016.11 | 18.7 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=true, Data augmentation=true2016.11 | 18.4 | |
| MTELabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 18.3 | |
| URTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 17.5 | |
| ESZSLLabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 17.1 | |
| IAPLabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 16.7 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=false, Data augmentation=true2016.11 | 16.5 | |
| DAPLabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 15.9 | |
| MTELabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 15.8 | |
| ZSECOCTraining Paradigm=Vision Training, Evaluation Protocol=Zero-shot2023.04 | 15.1 | |
| ESZSLLabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 15 | |
| HAALabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 14.9 | |
| UDALabel embedding=Attribute + Word-vector, Visual feature=Fisher Vector, Transductive=true, Data augmentation=false2016.11 | 14 | |
| UDALabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=true, Data augmentation=false2016.11 | 13.2 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=true, Data augmentation=false2016.11 | 13.1 | |
| SVELabel embedding=Word-vector, Visual feature=Bag of Words, Transductive=false, Data augmentation=false2016.11 | 12 | |
| SJELabel embedding=Attribute, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 12 | |
| SJELabel embedding=Word-vector, Visual feature=Fisher Vector, Transductive=false, Data augmentation=false2016.11 | 9.9 |