Visual Question Answering on VQAv2 (val)
75.33Accuracy (Overall)Shikra
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ShikraModel Size=13B2023.06 | 75.33 | — | — | — | — | |
| BLIP-22023.06 | 65.2 | — | — | — | — | |
| VPGTrans2023.06 | 65.2 | — | — | — | — | |
| PNP-VQA11BLanguage Model=UnifiedQAv2, Language #Params=11.3B, Language VL-aware=false, Vision Model=BLIP-Caption, Vision #Params=446M, Vision VL-aware=true, Zero-shot=true2022.10 | 63.3 | — | — | — | — | |
| PNP-VQA3BLanguage Model=UnifiedQAv2, Language #Params=2.9B, Language VL-aware=false, Vision Model=BLIP-Caption, Vision #Params=446M, Vision VL-aware=true, Zero-shot=true2022.10 | 62.1 | — | — | — | — | |
| PNP-VQAlargeLanguage Model=UnifiedQAv2, Language #Params=738M, Language VL-aware=false, Vision Model=BLIP-Caption, Vision #Params=446M, Vision VL-aware=true, Zero-shot=true2022.10 | 57.5 | — | — | — | — | |
| PNP-VQAbaseLanguage Model=UnifiedQAv2, Language #Params=223M, Language VL-aware=false, Vision Model=BLIP-Caption, Vision #Params=446M, Vision VL-aware=true, Zero-shot=true2022.10 | 54.3 | — | — | — | — | |
| BLIP-2+ (OPT2.7B)Backbone=OPT-2.7B, #Pretrain Image-Text=129M, Pretrain Uni-Text=false, Evaluation Protocol=Zero-shot2023.07 | 53.5 | — | — | — | — | |
| P-Former (OPT2.7B)Backbone=OPT-2.7B, #Pretrain Image-Text=4M, Pretrain Uni-Text=true, Evaluation Protocol=Zero-shot2023.07 | 52.6 | — | — | — | — | |
| BLIP-2 + MAFAEvaluation Protocol=Zero-shot2023.12 | 50.8 | — | — | — | — | |
| FewVLMlargeLanguage Model=T5, Language #Params=740M, Language VL-aware=false, Vision Model=Faster R-CNN, Vision #Params=64M, Vision VL-aware=false, Zero-shot=true2022.10 | 47.7 | — | — | — | — | |
| FewVLM#Pretrain Image-Text=9.2M, Pretrain Uni-Text=false, Evaluation Protocol=Zero-shot2023.07 | 47.7 | — | — | — | — | |
| BLIP-2 (OPT2.7B)Backbone=OPT-2.7B, #Pretrain Image-Text=4M, Pretrain Uni-Text=false, Evaluation Protocol=Zero-shot2023.07 | 46.8 | — | — | — | — | |
| BLIP-2Evaluation Protocol=Zero-shot2023.12 | 46.6 | — | — | — | — | |
| Few VLMbaseLanguage Model=T5, Language #Params=224M, Language VL-aware=false, Vision Model=Faster R-CNN, Vision #Params=64M, Vision VL-aware=false, Zero-shot=true2022.10 | 43.4 | — | — | — | — | |
| VLKD ViT-L/14Language Model=BART, Language #Params=408M, Language VL-aware=true, Vision Model=ViT-L/14, Vision #Params=305M, Vision VL-aware=true, Zero-shot=true2022.10 | 42.6 | — | — | — | — | |
| VLKD#Pretrain Image-Text=3M, Pretrain Uni-Text=false, Evaluation Protocol=Zero-shot2023.07 | 42.6 | — | — | — | — | |
| VLKD ViT-B/16Language Model=BART, Language #Params=407M, Language VL-aware=true, Vision Model=ViT-B/16, Vision #Params=87M, Vision VL-aware=true, Zero-shot=true2022.10 | 38.6 | — | — | — | — | |
| Frozen#Pretrain Image-Text=3M, Pretrain Uni-Text=false, Evaluation Protocol=Zero-shot2023.07 | 29.6 | — | — | — | — | |
| FrozenLanguage Model=GPT-like, Language #Params=7B, Language VL-aware=false, Vision Model=NF-ResNet-50, Vision #Params=40M, Vision VL-aware=false, Zero-shot=true2022.10 | 29.5 | — | — | — | — | |
| VL-T5no-vqaLanguage Model=T5, Language #Params=224M, Language VL-aware=false, Vision Model=Faster R-CNN, Vision #Params=64M, Vision VL-aware=false, Zero-shot=true2022.10 | 13.5 | — | — | — | — | |
| Frozenuses VQAv2 training data=false2021.06 | — | 29.5 | 35.7 | 38.2 | — | |
| Frozen finetuneduses VQAv2 training data=false2021.06 | — | 24 | 28.2 | 29.2 | — | |
| Frozen scratchuses VQAv2 training data=false2021.06 | — | 0 | 0 | 0 | — | |
| Frozen train-blinduses VQAv2 training data=false2021.06 | — | 26.2 | 33.5 | 33.3 | — | |
| Frozen VQAuses VQAv2 training data=true2021.06 | — | 48.4 | — | — | — | |
| Frozen VQA-blinduses VQAv2 training data=true2021.06 | — | 39.1 | — | — | — | |
| Oscaruses VQAv2 training data=true2021.06 | — | 73.8 | — | — | — |