Visual Question Answering (Multi-choice) on A-OKVQA (test)
87.2AccuracyHinD-CoT-Know
Evaluation Results
| Method | Links | |
|---|---|---|
| HinD-CoT-KnowModel Size=7B2025.11 | 87.2 | |
| HinD-KnowModel Size=7B2025.11 | 85.9 | |
| ReAuSE2025.11 | 85 | |
| BLIP-2Training data=129M image-text pairs2023.04 | 80.2 | |
| LLaVA-1.5Model Size=7B2025.11 | 77.1 | |
| InstructBLIPLLM Backbone=FlanT5-XXL, Evaluation Protocol=finetuning2023.05 | 76.7 | |
| QACap2025.11 | 76.7 | |
| Prophet2025.11 | 76.4 | |
| BLIP-2LLM Backbone=FlanT5-XXL, Evaluation Protocol=finetuning2023.05 | 76.2 | |
| Previous SOTAEvaluation Protocol=finetuning2023.05 | 73.6 | |
| InstructBLIPLLM Backbone=Vicuna-7B, Evaluation Protocol=finetuning2023.05 | 73.4 | |
| PromptCap2025.11 | 73.2 | |
| PromptCap + GPT-3Example retrieval=CLIP (ViT-L/14)2022.11 | 73.1 | |
| InstructBLIPModel Size=7B, Training=Fine-tuned (FT)2025.11 | 73 | |
| SAVEBackbone=LLaVA-1.6, Layer=20, Steering Strength=52025.12 | 70.04 | |
| BLIP-2LLM Backbone=Vicuna-7B, Evaluation Protocol=finetuning2023.05 | 69 | |
| MiniGPT-4 (Finetune Vicuna)Training data=5M image-text pairs, Unfreeze LLM=using LoRA2023.04 | 67.2 | |
| BaseBackbone=LLaVA-1.62025.12 | 66.89 | |
| SAVEBackbone=LLaVA-NeXT, Layer=24, Steering Strength=102025.12 | 66.81 | |
| BaseBackbone=LLaVA-NeXT2025.12 | 65.58 | |
| GPT-22025.11 | 60.3 | |
| MiniGPT-4Training data=5M image-text pairs2023.04 | 58.2 | |
| GPV-22022.11 | 53.7 | |
| ClipCap2022.11 | 43.8 | |
| KRISP2022.11 | 42.2 | |
| LXMERT2022.11 | 41.6 | |
| ViLBERT2022.11 | 41.5 | |
| Pythia2022.11 | 40.1 |