Knowledge-based Visual Question Answering on Infoseek (test)
53.4AccuracyProMSA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ProMSARetriever=BGE+EVA-CLIP, Model=Qwen3-VL-8B, Category=Retrieval-Augmented Models2026.06 | 53.4 | 53.6 | 53.3 | |
| ProMSARetriever=BGE+EVA-CLIP, Model=Qwen2.5-VL-7B, Category=Retrieval-Augmented Models2026.06 | 49.2 | 48.8 | 49.6 | |
| CC-VQARetriever=EVA-CLIP-8B, Model=Qwen2.5-VL-7B, Category=Retrieval-Augmented Models2026.06 | 45.1 | 44.7 | 46.1 | |
| REALRetriever=EVA-CLIP-8B, Model=Qwen3-VL-8B, Category=Retrieval-Augmented Models2026.06 | 44.1 | 43.1 | 45.1 | |
| MaS-VQARetriever=EVA-CLIP-8B, Model=Qwen3-VL-8B, Category=Retrieval-Augmented Models2026.06 | 43.8 | 43.7 | 43.9 | |
| ProMSARetriever=BGE+EVA-CLIP, Model=Qwen3-VL-2B, Category=Retrieval-Augmented Models2026.06 | 43.6 | 44.1 | 43 | |
| DeepEyesV2*Retriever=BGE+EVA-CLIP, Model=Qwen2.5-VL-7B, Category=Search-Agent Models2026.06 | 41.3 | 41.6 | 40.8 | |
| MMSearch-R1*Retriever=BGE+EVA-CLIP, Model=Qwen2.5-VL-7B, Category=Search-Agent Models2026.06 | 39.7 | 40.3 | 39.3 | |
| EchoSight†Retriever=EVA-CLIP-8B, Model=Qwen3-VL-8B, Category=Retrieval-Augmented Models2026.06 | 32.4 | 32.6 | 32.2 | |
| RA-VQAv2 w/ PreFLMR2024.12 | 30.7 | — | — | |
| EchoSightRetriever=EVA-CLIP-8B, Model=Mistral-7B, Category=Retrieval-Augmented Models2026.06 | 30.4 | 30 | 30.7 | |
| LamRATraining=Simultaneous retrieval and VQA using LoRA2024.12 | 28.8 | — | — | |
| Qwen3-VL-8BRetriever=None, Model=None, Category=Zero-shot MLLMs2026.06 | 25.7 | 25.9 | 25.5 | |
| Qwen2.5-VL-7BRetriever=None, Model=None, Category=Zero-shot MLLMs2026.06 | 23.7 | 22.8 | 24.1 | |
| Qwen3-VL-2BRetriever=None, Model=None, Category=Zero-shot MLLMs2026.06 | 18.9 | 18.6 | 19.2 | |
| GPT-4VRetriever=None, Model=None, Category=Zero-shot MLLMs2026.06 | 14.6 | 15 | 14.3 | |
| BLIP-2Retriever=None, Model=Flan-T5, Category=Zero-shot MLLMs2026.06 | 12.5 | 12.7 | 12.3 |