Visual Commonsense Reasoning on VCR 1.0 (test)
59Q->A AccuracyBLIP-2 ViT-G + LSKD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BLIP-2 ViT-G + LSKDEvaluation Protocol=Zero-shot, Backbone=ViT-G2023.12 | 59 | 56.4 | 33.4 | |
| CLIP ViT-L-14x336Evaluation Protocol=Zero-shot, Backbone=ViT-L-14x3362023.12 | 56.3 | 51.3 | 29.9 | |
| BLIP-2 ViT-GEvaluation Protocol=Zero-shot, Backbone=ViT-G2023.12 | 56.1 | 49.8 | 28 | |
| CLIP ViT-B-16*Evaluation Protocol=Zero-shot, Backbone=ViT-B-162023.12 | 54.8 | 48.6 | 26.6 | |
| CLIP-EventEvaluation Protocol=Zero-shot2023.12 | 52.4 | 49.2 | — | |
| BLIP-2 ViT-LEvaluation Protocol=Zero-shot, Backbone=ViT-L2023.12 | 52.3 | 48.1 | 25.3 | |
| BLIP ViT-LEvaluation Protocol=Zero-shot, Backbone=ViT-L2023.12 | 47.2 | 42.5 | 20.1 |