Visual Question Answering on InfoSeek
69AccuracyGemini-3-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3-FlashAgent Type=Direct Answer2026.04 | 69 | |
| MIAAgent Type=Memory-based Search Agent2026.04 | 65.5 | |
| Unsupervised MIAAgent Type=Memory-based Search Agent2026.04 | 64.3 | |
| DR-MMSearchAgentEvaluation Paradigm=Search Agent2026.04 | 60 | |
| ReasoningBankAgent Type=Memory-based Search Agent2026.04 | 59.5 | |
| ExpeLAgent Type=Memory-based Search Agent2026.04 | 58.6 | |
| MementoAgent Type=Memory-based Search Agent2026.04 | 57.3 | |
| No MemoryAgent Type=Memory-based Search Agent2026.04 | 56.8 | |
| MAD-RAGModel Family=Qwen3-VL-8B2026.01 | 55.93 | |
| RAGAgent Type=Memory-based Search Agent2026.04 | 55.9 | |
| MMSearch-R1Tool=Search, Model Size=7B2025.11 | 55.1 | |
| MMSearch-R1Evaluation Paradigm=Search Agent2026.04 | 55.1 | |
| Qwen-2.5-VLTool=Search, Model Size=7B2025.11 | 53.7 | |
| MAD-RAGModel Family=Qwen3-VL-4B2026.01 | 53.29 | |
| Vanilla RAGModel Family=Qwen3-VL-8B2026.01 | 52.66 | |
| Vanilla RAGModel Family=Qwen3-VL-4B2026.01 | 52.12 | |
| DeepEyesV2Tool=General, Model Size=7B2025.11 | 51.1 | |
| Deepeyes2Agent Type=Search Agent2026.04 | 51.1 | |
| Deepeyes2Evaluation Paradigm=Search Agent2026.04 | 51.1 | |
| GoG-2.5-7B-RLEvaluation Methodology=Search-Equipped Models2026.01 | 51.05 | |
| GoG-3-8B-Think-RLEvaluation Methodology=Search-Equipped Models2026.01 | 49.05 | |
| MMSearch-R1Agent Type=Search Agent2026.04 | 49 | |
| Mem0Agent Type=Memory-based Search Agent2026.04 | 48.2 | |
| DeepMMSearch-R1Agent Type=Search Agent2026.04 | 47.5 | |
| DeepMMSearch-R1Evaluation Paradigm=Search Agent2026.04 | 47.5 | |
| GPT-5.4Agent Type=Direct Answer2026.04 | 43.6 | |
| GPT4oTool=✗, Model Size=-2025.11 | 42.7 | |
| GPT-4oAgent Type=Direct Answer2026.04 | 42.7 | |
| GPT-4oEvaluation Paradigm=Direct2026.04 | 42.7 | |
| GoG-2.5-7B-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 41.9 | |
| GoG-3-8B-Think-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 40.55 | |
| Qwen2.5-VL-7BEvaluation Methodology=Full-Search Workflow2026.01 | 38.15 | |
| Qwen2.5-VL-32B+ReACTAgent Type=Search Agent2026.04 | 38 | |
| Qwen2.5-VL-32BEvaluation Paradigm=Search Agent2026.04 | 38 | |
| Gemini 2.5 ProTool=✗, Model Size=-2025.11 | 37 | |
| Gemini-2.5-ProAgent Type=Direct Answer2026.04 | 37 | |
| Gemini2.5 ProEvaluation Paradigm=Direct2026.04 | 37 | |
| A-MemAgent Type=Memory-based Search Agent2026.04 | 36 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Full-Search Workflow2026.01 | 32.25 | |
| Qwen3-VL-8B-ThinkEvaluation Methodology=Prompt-based GoG Method2026.01 | 32 | |
| GPT-4oEvaluation Methodology=Direct Answer2026.01 | 30.6 | |
| Qwen2.5-VL-7B+ReACTAgent Type=Search Agent2026.04 | 28.3 | |
| Qwen2.5-VL-7BEvaluation Paradigm=Search Agent2026.04 | 28.3 | |
| Qwen2.5-VL-32BAgent Type=Direct Answer2026.04 | 25.8 | |
| Qwen2.5-VL-32BEvaluation Paradigm=Direct2026.04 | 25.8 | |
| MMSearch-R1*Evaluation Methodology=Search-Equipped Models2026.01 | 24.65 | |
| Qwen2.5-VL-7BAgent Type=Direct Answer2026.04 | 23.9 | |
| Qwen2.5-VL-7BEvaluation Paradigm=Direct2026.04 | 23.9 | |
| UniversalRAG (InternVL3.5-1B)Router Model=InternVL3.5-1B2025.04 | 23.35 | |
| OracleRetrieval Type=Oracle, Generator=Qwen3-VL-8B-Instruct2025.04 | 23.35 | |
| UniversalRAG (Qwen3-VL-2B-Instruct)Router Type=Trained, Router Model=Qwen3-VL-2B-Instruct, Generator=Qwen3-VL-8B-Instruct2025.04 | 23.2 | |
| Qwen3-VL-30B-A3B-ThinkingEvaluation Methodology=Direct Answer2026.01 | 22.8 | |
| Qwen-2.5-VLTool=✗, Model Size=7B2025.11 | 20.1 | |
| Closed-bookModel Family=Qwen3-VL-8B2026.01 | 18.73 | |
| Qwen2.5-VL-7BEvaluation Methodology=Prompt-based GoG Method2026.01 | 17.4 | |
| Qwen2.5-VL-32BEvaluation Methodology=Direct Answer2026.01 | 16.95 | |
| Qwen3-VL-30B-A3B-InstructEvaluation Methodology=Direct Answer2026.01 | 16.7 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Direct Answer2026.01 | 16.05 | |
| Closed-bookModel Family=Qwen3-VL-4B2026.01 | 15.76 | |
| CVLMLLM=Qwen-VL2024.02 | 15.45 | |
| Qwen-VLLLM=Qwen2024.02 | 15.21 | |
| Qwen2.5-VL-7BEvaluation Methodology=Direct Answer2026.01 | 13.9 | |
| Qwen3-VL-8B-InstructEvaluation Methodology=Direct Answer2026.01 | 13.8 | |
| CVLM (3M IKPairs, Objects=5)LLM=Vicuna-7B, Objects=52024.02 | 11.27 | |
| CVLM (3M IKPairs) w/o FKALLM=Vicuna-7B2024.02 | 11.21 | |
| CVLM (3M IKPairs, Objects=8)LLM=Vicuna-7B, Objects=82024.02 | 10.78 | |
| CVLMLLM=Vicuna-7B2024.02 | 10.72 | |
| BLIP2LLM=Flan-T5-XXL2024.02 | 10.67 | |
| CVLM (3M IKPairs, Objects=3)LLM=Vicuna-7B, Objects=32024.02 | 10.42 | |
| InstructBLIPLLM=Flan-T5-XL2024.02 | 10.3 | |
| InstructBLIPLLM=Vicuna-7B2024.02 | 10.05 | |
| MiniGPT4LLM=Vicuna-7B2024.02 | 10.03 | |
| CVLM (3M IKPairs, Objects=1)LLM=Vicuna-7B, Objects=12024.02 | 10.01 | |
| CVLM w/o FKALLM=Vicuna-7B2024.02 | 9.33 | |
| InstructBLIPLLM=Flan-T5-XXL2024.02 | 8.36 | |
| LLaVA-v1.5†LLM=Vicuna-7B2024.02 | 8.18 | |
| CVLM w/o (FKA & VKA)LLM=Vicuna-7B2024.02 | 8.18 |