Visual Question Answering on SimpleVQA (Accuracy)
0.7818AccuracyGPT-5.2
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.2Workflow=Agentic Model (zero-shot), Model Type=Proprietary2026.06 | 0.7818 | |
| Gemini-3-ProWorkflow=Agentic Model (zero-shot), Model Type=Proprietary2026.06 | 0.7591 | |
| Gemini-2.5 ProEvaluation Setting=Agent Workflow2026.05 | 0.743 | |
| Gemini-3-FlashAgent Type=Direct Answer2026.04 | 0.737 | |
| TAPOWorkflow=Agentic Model, Model Type=Open-source, Backbone=SAPO2026.06 | 0.7364 | |
| Gemini-2.5 ProEvaluation Setting=Direct Reasoning2026.05 | 0.727 | |
| Qwen3-VL-30B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 0.71 | |
| GPT-5Workflow=Agentic Model (zero-shot), Model Type=Proprietary2026.06 | 0.7058 | |
| Qwen3-VL-8B-Instruct+SAPOWorkflow=Agentic Model, Model Type=Open-source2026.06 | 0.7038 | |
| Qwen3-VL-8B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 0.703 | |
| Qwen3-VL-30B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 0.703 | |
| SenseNova-MARS-8BWorkflow=Agentic Search MLLM2026.04 | 0.702 | |
| SenseNova-MARSWorkflow=Agentic Model, Model Type=Open-source2026.06 | 0.7019 | |
| Gemini-2.5-FlashWorkflow=Agentic Model (zero-shot), Model Type=Proprietary2026.06 | 0.6881 | |
| POINTS-Seeker-8BWorkflow=Agentic Search MLLM2026.04 | 0.688 | |
| Gemini-2.5 FlashWorkflow=RAG Workflow2026.04 | 0.686 | |
| Qwen3-VL-8B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 0.683 | |
| Gemini-3-FlashWorkflow=Agentic Model (zero-shot), Model Type=Proprietary2026.06 | 0.6792 | |
| MM-DeepResearch 32BEvaluation Paradigm=Agentic Search2026.03 | 0.676 | |
| GPT-5Evaluation Setting=Agent Workflow2026.05 | 0.673 | |
| Gemini-2.5 FlashEvaluation Setting=Agent Workflow2026.05 | 0.673 | |
| Gemini-2.5 FlashEvaluation Setting=Direct Reasoning2026.05 | 0.67 | |
| GoG-3-8B-Think-RLEvaluation Methodology=Search-Equipped Models2026.01 | 0.6644 | |
| GPT-5Evaluation Setting=Direct Reasoning2026.05 | 0.66 | |
| MM-DeepResearch-8BEvaluation Paradigm=Agentic Search2026.03 | 0.659 | |
| MM-DeepResearch-8BWorkflow=Agentic Search MLLM2026.04 | 0.659 | |
| GoG-3-8B-Think-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 0.6565 | |
| Qwen2.5-VL-32B-InstructWorkflow=Agentic Model (zero-shot), Model Type=Open-source2026.06 | 0.6515 | |
| MIAAgent Type=Memory-based Search Agent2026.04 | 0.649 | |
| GoG-2.5-7B-RLEvaluation Methodology=Search-Equipped Models2026.01 | 0.6486 | |
| Qwen3-VL-32B-InstructWorkflow=Agentic Model (zero-shot), Model Type=Open-source2026.06 | 0.6417 | |
| Gemini-3-ProWorkflow=Direct Answer, Model Type=Proprietary2026.06 | 0.6407 | |
| Qwen3-VL-30BEvaluation Setting=Visual-Native Agent Harness2026.05 | 0.637 | |
| GPT-4oWorkflow=Agentic Model (zero-shot), Model Type=Proprietary2026.06 | 0.6367 | |
| GPT-4oEvaluation Paradigm=RAG Workflow2026.03 | 0.636 | |
| Gemini-3-FlashWorkflow=Direct Answer, Model Type=Proprietary2026.06 | 0.6357 | |
| Unsupervised MIAAgent Type=Memory-based Search Agent2026.04 | 0.633 | |
| DR-MMSearchAgentEvaluation Paradigm=Search Agent2026.04 | 0.632 | |
| No MemoryAgent Type=Memory-based Search Agent2026.04 | 0.63 | |
| Qwen3-VL-8B-ThinkEvaluation Methodology=Prompt-based GoG Method2026.01 | 0.6269 | |
| ExpeLAgent Type=Memory-based Search Agent2026.04 | 0.625 | |
| Qwen3-VL-8BEvaluation Paradigm=RAG Workflow2026.03 | 0.623 | |
| Qwen3-VL-8B-InstructWorkflow=Agentic Model (zero-shot), Model Type=Open-source2026.06 | 0.6229 | |
| MM-DeepResearch-7BEvaluation Paradigm=Agentic Search2026.03 | 0.62 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Full-Search Workflow2026.01 | 0.619 | |
| MementoAgent Type=Memory-based Search Agent2026.04 | 0.619 | |
| SenseNova-MARS-8BEvaluation Paradigm=Agentic Search2026.03 | 0.617 | |
| GPT-5Workflow=Direct Answer2026.04 | 0.617 | |
| GPT-5Workflow=Direct Answer, Model Type=Proprietary2026.06 | 0.617 | |
| GPT-4oWorkflow=RAG Workflow2026.04 | 0.616 | |
| ERNIE 5.0-BaseModel type=pre-trained2026.02 | 0.6154 | |
| GoG-2.5-7B-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 0.6061 | |
| RAGAgent Type=Memory-based Search Agent2026.04 | 0.605 | |
| ReasoningBankAgent Type=Memory-based Search Agent2026.04 | 0.604 | |
| GPT-5.2Workflow=Direct Answer, Model Type=Proprietary2026.06 | 0.5992 | |
| DeepEyes-v2-7BEvaluation Paradigm=Agentic Search2026.03 | 0.594 | |
| DeepEyesV2Tool=General, Model Size=7B2025.11 | 0.594 | |
| Deepeyes2Agent Type=Search Agent2026.04 | 0.594 | |
| DeepEyesV2Workflow=Agentic Search MLLM2026.04 | 0.594 | |
| Deepeyes2Evaluation Paradigm=Search Agent2026.04 | 0.594 | |
| DeepEyesV2Workflow=Agentic Model, Model Type=Open-source2026.06 | 0.594 | |
| Claude-3.7-SonnetWorkflow=RAG Workflow2026.04 | 0.593 | |
| Qwen2.5-VL-7BEvaluation Methodology=Full-Search Workflow2026.01 | 0.5913 | |
| WebWatcher-32BEvaluation Paradigm=Agentic Search2026.03 | 0.59 | |
| WebWatcher-32BWorkflow=Agentic Search MLLM2026.04 | 0.59 | |
| WebWatcher-32BEvaluation Setting=Deep Search Agent2026.05 | 0.59 | |
| Qwen3-VL-32BEvaluation Paradigm=Agentic Search2026.03 | 0.587 | |
| Qwen-2.5-VL-72BWorkflow=RAG Workflow2026.04 | 0.586 | |
| Qwen3-VL-32BEvaluation Paradigm=Direct Reasoning2026.03 | 0.58 | |
| MMSearch-R1-7BEvaluation Paradigm=Agentic Search2026.03 | 0.574 | |
| MMSearch-R1Tool=Search, Model Size=7B2025.11 | 0.574 | |
| MMSearch-R1-7BWorkflow=Agentic Search MLLM2026.04 | 0.574 | |
| MMSearch-R1Evaluation Paradigm=Search Agent2026.04 | 0.574 | |
| MMSearch-R1-7BEvaluation Setting=Deep Search Agent2026.05 | 0.574 | |
| MMSearch-R1Workflow=Agentic Model, Model Type=Open-source2026.06 | 0.574 | |
| GPT-5 miniVersion=high2026.05 | 0.568 | |
| Mem0Agent Type=Memory-based Search Agent2026.04 | 0.567 | |
| GPT-5Evaluation Paradigm=RAG Workflow2026.03 | 0.559 | |
| DeepMMSearch-R1Agent Type=Search Agent2026.04 | 0.559 | |
| DeepMMSearch-R1-7BWorkflow=Agentic Search MLLM2026.04 | 0.559 | |
| DeepMMSearch-R1Evaluation Paradigm=Search Agent2026.04 | 0.559 | |
| DeepMMSearch-R1Workflow=Agentic Model, Model Type=Open-source2026.06 | 0.5587 | |
| DeepMMSearch-R1-7BEvaluation Paradigm=Agentic Search2026.03 | 0.558 | |
| GPT-5.4Agent Type=Direct Answer2026.04 | 0.555 | |
| Gemini-2.5 FlashWorkflow=Direct Answer2026.04 | 0.555 | |
| Gemini-2.5-FlashWorkflow=Direct Answer, Model Type=Proprietary2026.06 | 0.5548 | |
| MMSearch-R1Agent Type=Search Agent2026.04 | 0.553 | |
| MMSearch-R1*Evaluation Methodology=Search-Equipped Models2026.01 | 0.5479 | |
| RLR³Training Source=OpenMMR2026.05 | 0.546 | |
| WebWatcher-7BEvaluation Paradigm=Agentic Search2026.03 | 0.543 | |
| WebWatcherTool=Search, Model Size=7B2025.11 | 0.543 | |
| WebWatcherAgent Type=Search Agent2026.04 | 0.543 | |
| WebWatcher-7BWorkflow=Agentic Search MLLM2026.04 | 0.543 | |
| WebWatcherEvaluation Paradigm=Search Agent2026.04 | 0.543 | |
| WebWatcher-7BEvaluation Setting=Deep Search Agent2026.05 | 0.543 | |
| Official thinkingSource=Qwen3-VL2026.05 | 0.543 | |
| GPT-5Evaluation Paradigm=Direct Reasoning2026.03 | 0.541 | |
| RLVRTraining Source=ViRL2026.05 | 0.54 | |
| Gemini 2.5 ProTool=✗, Model Size=-2025.11 | 0.534 | |
| Gemini-2.5-ProAgent Type=Direct Answer2026.04 | 0.534 |