Direct Answer Visual Question Answering on A-OKVQA (test)
69AccuracyHinD-CoT-Know
Evaluation Results
| Method | Links | |
|---|---|---|
| HinD-CoT-KnowModel Size=7B2025.11 | 69 | |
| HinD-KnowModel Size=7B2025.11 | 67.8 | |
| ReAuSE2025.11 | 67.7 | |
| QACap2025.11 | 66.3 | |
| LLaVA-1.5Model Size=7B2025.11 | 63.7 | |
| InstructBLIPModel Size=7B, Training=Fine-tuned (FT)2025.11 | 62.4 | |
| Qwen2-VLModel Size=7B, Training=Fine-tuned (FT)2025.11 | 61.5 | |
| Minigpt4-v2Model Size=7B, Training=Fine-tuned (FT)2025.11 | 61.3 | |
| PromptCap + GPT-3Example retrieval=CLIP (ViT-L/14)2022.11 | 59.6 | |
| SimKBVQA2025.11 | 58.6 | |
| Prophet2025.11 | 58.2 | |
| PromptCap2025.11 | 56.3 | |
| REVEAL2025.11 | 52.2 | |
| MM-CoT2025.11 | 50.6 | |
| VisualCoT2025.11 | 50.5 | |
| GPT-22025.11 | 48.6 | |
| GPV-22022.11 | 40.7 | |
| KRISP2022.11 | 27.1 | |
| ViLBERT2022.11 | 25.9 | |
| LXMERT2022.11 | 25.9 | |
| Pythia2022.11 | 21.9 | |
| ClipCap2022.11 | 15.8 |