Fact-based Visual Question Answering on FVQA
74.2AccuracyVision-DeepResearch-30B-A3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Vision-DeepResearch-30B-A3BWorkflow=Agent Workflow2026.01 | 74.2 | |
| POINTS-Seeker-8BWorkflow=Agentic Search MLLM2026.04 | 71.2 | |
| Qwen3-VL-30B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 69.3 | |
| MM-DeepResearch-8BWorkflow=Agentic Search MLLM2026.04 | 69.2 | |
| GPT-5Workflow=Agent Workflow2026.01 | 69 | |
| Claude-4-SonnetWorkflow=Agent Workflow2026.01 | 69 | |
| GPT-5Workflow=Agent Workflow2026.04 | 69 | |
| Claude-4-SonnetWorkflow=Agent Workflow2026.04 | 69 | |
| Claude-4-SonnetEvaluation Setting=Agent Workflow2026.05 | 69 | |
| Gemini-2.5 ProWorkflow=Agent Workflow2026.01 | 68.3 | |
| Gemini-2.5 FlashWorkflow=Agent Workflow2026.01 | 68 | |
| Gemini-2.5 FlashWorkflow=Agent Workflow2026.04 | 68 | |
| Claude-3.7-SonnetWorkflow=Agent Workflow2026.01 | 67.3 | |
| Claude-3.7-SonnetEvaluation Setting=Agent Workflow2026.05 | 67.3 | |
| Skywork-R1V4-30B-A3BWorkflow=Agentic Search MLLM2026.04 | 67.2 | |
| SenseNova-MARS-8BWorkflow=Agentic Search MLLM2026.04 | 67.1 | |
| Qwen3-VL-30B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 66.3 | |
| Gemini-2.5 ProEvaluation Setting=Agent Workflow2026.05 | 65 | |
| Vision-DeepResearch-8BWorkflow=Agent Workflow2026.01 | 64.7 | |
| Vision-DeepResearch-8BWorkflow=Agentic Search MLLM2026.04 | 64.7 | |
| Qwen3-VL-8B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 64.7 | |
| Qwen3-VL-30B-A3B-ThinkingWorkflow=Agent Workflow2026.01 | 63 | |
| GPT-5Evaluation Setting=Agent Workflow2026.05 | 62 | |
| Qwen3-VL-8B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 62 | |
| Gemini-2.5 ProWorkflow=Direct Answer2026.01 | 60.7 | |
| Gemini-2.5 ProEvaluation Setting=Direct Reasoning2026.05 | 60.7 | |
| DeepEyesV2Workflow=Agentic Search MLLM2026.04 | 60.6 | |
| Qwen3-VL-8B-InstructWorkflow=Agent Workflow2026.01 | 58.7 | |
| MMSearch-R1-7BWorkflow=Multimodal DeepResearch MLLM2026.01 | 58.4 | |
| MMSearch-R1-7BWorkflow=Agentic Search MLLM2026.04 | 58.4 | |
| MMSearch-R1-7BEvaluation Setting=Deep Search Agent2026.05 | 58.4 | |
| Qwen3-VL-30B-A3B-InstructWorkflow=Agent Workflow2026.01 | 57.7 | |
| GPT-5Workflow=Direct Answer2026.01 | 57.3 | |
| GPT-5Workflow=Direct Answer2026.04 | 57.3 | |
| GPT-5Evaluation Setting=Direct Reasoning2026.05 | 56.3 | |
| Gemini-2.5 FlashEvaluation Setting=Agent Workflow2026.05 | 54.7 | |
| Qwen3-VL-30BEvaluation Setting=Visual-Native Agent Harness2026.05 | 54.3 | |
| Qwen3-VL-8B-ThinkingWorkflow=Agent Workflow2026.01 | 51.3 | |
| Qwen3-VL-8B-ThinkingWorkflow=Agent Workflow2026.04 | 51.3 | |
| Gemini-2.5 FlashWorkflow=Direct Answer2026.01 | 47.7 | |
| Gemini-2.5 FlashWorkflow=Direct Answer2026.04 | 47.7 | |
| Gemini-2.5 FlashEvaluation Setting=Direct Reasoning2026.05 | 47.7 | |
| Qwen3-VL-8BEvaluation Setting=Agent Workflow2026.05 | 45.3 | |
| Qwen3-VL-30BEvaluation Setting=Agent Workflow2026.05 | 45.3 | |
| Qwen3-VL-8BEvaluation Setting=Visual-Native Agent Harness2026.05 | 44.7 | |
| Claude-3.7-SonnetWorkflow=Direct Answer2026.01 | 36.7 | |
| Claude-3.7-SonnetEvaluation Setting=Direct Reasoning2026.05 | 35.7 | |
| Claude-4-SonnetWorkflow=Direct Answer2026.01 | 35.3 | |
| Claude-4-SonnetWorkflow=Direct Answer2026.04 | 35.3 | |
| Claude-4-SonnetEvaluation Setting=Direct Reasoning2026.05 | 35.3 | |
| Qwen3-VL-30B-A3B-InstructWorkflow=Direct Answer2026.01 | 34.7 | |
| Qwen3-VL-30BEvaluation Setting=Direct Reasoning2026.05 | 34.7 | |
| Qwen3-VL-30B-A3B-ThinkingWorkflow=Direct Answer2026.01 | 32.7 | |
| MiMoVL 7B-RLRL=MiMoVL, Initial Model=7B-SFT2026.04 | 31.8 | |
| GPT-5 NanoRL=N/A, Initial Model=N/A2026.04 | 29.4 | |
| Qwen3-VL-8B-InstructWorkflow=Direct Answer2026.01 | 28 | |
| Qwen3-VL-8B-InstructWorkflow=Direct Answer2026.04 | 28 | |
| Qwen3-VL-8BEvaluation Setting=Direct Reasoning2026.05 | 28 | |
| Vero Mi-7BRL=MiMoVL, Initial Model=7B-SFT2026.04 | 27.9 | |
| Vero Q25-7BRL=Qwen25VL, Initial Model=7B Inst2026.04 | 26.3 | |
| Q3VL 8B-InsRL=N/A, Initial Model=N/A2026.04 | 26 | |
| Vero Q3I-8BRL=Qwen3VL, Initial Model=8B Inst2026.04 | 24.6 | |
| Q3VL 8B-ThkRL=N/A, Initial Model=N/A2026.04 | 24.2 | |
| Qwen3-VL-8B-ThinkingWorkflow=Direct Answer2026.01 | 24 | |
| Vero Q3T-8BRL=Qwen3VL, Initial Model=8B Think2026.04 | 22 | |
| Q25VL 7B-InsRL=N/A, Initial Model=N/A2026.04 | 21.9 | |
| Mo2-O 7BRL=SFT Only, Initial Model=N/A2026.04 | 17.7 |