Knowledge-Intensive Visual Question Answering on InfoSeek (val)
44.1Accuracy (All)REAL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| REALRetriever=EVA-CLIP-8B, Model=Qwen3-VL-8B2026.02 | 44.1 | 43.1 | 45.1 | |
| REALRetriever=EVA-CLIP-8B, Model=InternVL3.5-8B2026.02 | 43.8 | 43.8 | 43.7 | |
| MaS-VQAModel=Qwen3-VL-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 43.8 | 43.7 | 43.9 | |
| MaS-VQAModel=InternVL3-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 42.8 | 42.9 | 42.6 | |
| VLM-PRFRetriever=EVA-CLIP-8B, Model=InternVL3-8B2026.02 | 42.5 | 43.5 | 42.1 | |
| VLM-PRFModel=InternVL3-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 42.5 | 43.5 | 42.1 | |
| VLM-PRFRetriever=EVA-CLIP-8B, Model=LLaMA3.1-8B2026.02 | 40.8 | 41.3 | 40.6 | |
| mKG-RAGRetriever=CLIP-ViT-L, Model=LLaMA3-8B2026.02 | 40.5 | 41.4 | 39.6 | |
| ReflectiVARetriever=EVA-CLIP-8B, Model=LLaMA3.1-8B2026.02 | 40.2 | 40.4 | 39.8 | |
| ReflectiVAModel=LLaMA-3.1-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 40.1 | 40.4 | 39.8 | |
| InternVL3.5-38B + LoTBackbone=InternVL3.5-38B, Model Scale=Large, Method=LoT2026.04 | 36.8 | 36.6 | 36.9 | |
| MMKB-RAGModel=Qwen2-7B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 36.4 | 36.4 | 36.3 | |
| REALRetriever=EVA-CLIP-8B, Model=Qwen3-VL-2B2026.02 | 33.4 | 33.2 | 33.6 | |
| InternVL3.5-4B + LoTBackbone=InternVL3.5-4B, Model Scale=Small, Method=LoT2026.04 | 33.2 | 33.3 | 33.1 | |
| InternVL3.5-38BBackbone=InternVL3.5-38B, Model Scale=Large, Method=Zero-shot retrieval-augmented2026.04 | 33.1 | 33.1 | 33 | |
| Qwen3-VL-8B + LoTBackbone=Qwen3-VL-8B, Model Scale=Medium, Method=LoT2026.04 | 32.8 | 33.2 | 32.5 | |
| InternVL3.5-8B + LoTBackbone=InternVL3.5-8B, Model Scale=Medium, Method=LoT2026.04 | 32.3 | 32.1 | 32.5 | |
| REALRetriever=EVA-CLIP-8B, Model=LLaVA-1.5-7B2026.02 | 31.8 | 30.6 | 33 | |
| Qwen3-VL-4B + LoTBackbone=Qwen3-VL-4B, Model Scale=Small, Method=LoT2026.04 | 30.5 | 30.8 | 30.2 | |
| Qwen2-VL-7B + LoTBackbone=Qwen2-VL-7B, Model Scale=Medium, Method=LoT2026.04 | 29.9 | 29.8 | 30.1 | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B, Model Scale=Medium, Method=Zero-shot retrieval-augmented2026.04 | 29.7 | 29.1 | 30.4 | |
| InternVL3.5-8BBackbone=InternVL3.5-8B, Model Scale=Medium, Method=Zero-shot retrieval-augmented2026.04 | 29.7 | 29.5 | 29.9 | |
| Qwen2.5-VL-32B + LoTBackbone=Qwen2.5-VL-32B, Model Scale=Large, Method=LoT2026.04 | 29.6 | 31.2 | 26.2 | |
| NoteMRRetriever=EVA-CLIP-8B, Model=Qwen3-VL-8B2026.02 | 29.2 | 28.7 | 29.8 | |
| NoteMRModel=Qwen3-VL-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 29.2 | 28.7 | 29.8 | |
| Wiki-LLAVARetriever=CLIP-ViT-L, Model=LLaVA-1.5-7B2026.02 | 28.9 | 30.1 | 27.8 | |
| Wiki-LLaVAModel=Vicuna-7B, Retrieval Mode=CLIP ViT-L/14+Contriever, Category=Retrieval-Augmented Models2026.02 | 28.9 | 30.1 | 27.8 | |
| InternVL3.5-4BBackbone=InternVL3.5-4B, Model Scale=Small, Method=Zero-shot retrieval-augmented2026.04 | 28.9 | 28.8 | 29 | |
| Qwen3-VL-4BBackbone=Qwen3-VL-4B, Model Scale=Small, Method=Zero-shot retrieval-augmented2026.04 | 28.3 | 27.9 | 28.6 | |
| EchoSightModel=Mistral-7B/LLaMA-3-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 27.7 | — | — | |
| EchoSightRetriever=EVA-CLIP-8B, Model=LLaVA-1.5-7B2026.02 | 26.8 | 27.3 | 26.3 | |
| Qwen2.5-VL-32BBackbone=Qwen2.5-VL-32B, Model Scale=Large, Method=Zero-shot retrieval-augmented2026.04 | 26.4 | 26.7 | 26.1 | |
| RORA-VLMRetriever=CLIP+Google Search, Model=LLaVA-1.5-7B2026.02 | 26.2 | 25.1 | 27.3 | |
| Qwen2.5-VL-3B + LoTBackbone=Qwen2.5-VL-3B, Model Scale=Small, Method=LoT2026.04 | 25.2 | 25.4 | 25.1 | |
| VKC-MIRRetriever=OPT-66B, Model=mPLUG-Owl3-8B2026.02 | 25.1 | — | — | |
| Qwen2.5-VL-7B + LoTBackbone=Qwen2.5-VL-7B, Model Scale=Medium, Method=LoT2026.04 | 25.1 | 24.9 | 25.4 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Model Scale=Medium, Method=Zero-shot retrieval-augmented2026.04 | 24.5 | 23.9 | 25.2 | |
| Qwen2-VL-7BBackbone=Qwen2-VL-7B, Model Scale=Medium, Method=Zero-shot retrieval-augmented2026.04 | 24.4 | 24.2 | 24.7 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Model Scale=Small, Method=Zero-shot retrieval-augmented2026.04 | 22.4 | 22.6 | 22.2 | |
| Qwen3-VL-8BModel=Qwen3-VL-8B, Retrieval Mode=-, Category=Zero-shot MLLMs2026.02 | 18.5 | 19.7 | 17.4 | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B, Retrieval Mode=-, Category=Zero-shot MLLMs2026.02 | 16.3 | 16.8 | 15.8 | |
| GPT-4VModel=GPT-4V, Retrieval Mode=-, Category=Zero-shot MLLMs2026.02 | 14.6 | 15 | 14.3 | |
| BLIP-2Model=Flan-T5XL, Retrieval Mode=-, Category=Zero-shot MLLMs2026.02 | 12.5 | 12.7 | 12.3 | |
| InternVL3-8BModel=InternVL3-8B, Retrieval Mode=-, Category=Zero-shot MLLMs2026.02 | 12.5 | 13.5 | 11.7 | |
| DPR V+TModel=Multi-passage BERT, Retrieval Mode=CLIP ViT-B/32, Category=Retrieval-Augmented Models2026.02 | 12.4 | — | — | |
| Prophet++Retriever=EVA-CLIP-8B, Model=Qwen3-VL-8B2026.02 | 12.3 | 13.2 | 11.6 | |
| Prophet++Model=Qwen3-VL-8B, Retrieval Mode=EVA-CLIP-8B, Category=Retrieval-Augmented Models2026.02 | 12.3 | 13.2 | 11.6 | |
| Qwen2-VL-2B + LoTBackbone=Qwen2-VL-2B, Model Scale=Small, Method=LoT2026.04 | 10.3 | 10.5 | 10.1 | |
| Qwen2-VL-2BBackbone=Qwen2-VL-2B, Model Scale=Small, Method=Zero-shot retrieval-augmented2026.04 | 5.4 | 5.3 | 5.6 | |
| PromptCapRetriever=EVA-CLIP-8B, Model=Flan-T5-11B2026.02 | 4.1 | 4.3 | 3.8 |