Multimodal Deep Search on FVQA (Accuracy)
76.67AccuracyGemini-3 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3 ProEvaluation Protocol=Agent Workflow2026.04 | 76.67 | |
| MTA-DeepSearch-32BEvaluation Protocol=Ours, Model Scale=32B2026.04 | 76 | |
| MTA-DeepSearch-8BEvaluation Protocol=Ours, Model Scale=8B2026.04 | 73.06 | |
| SenseNova-MARS-32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 72.61 | |
| Gemini-2.5 ProEvaluation Protocol=Agent Workflow2026.04 | 72.33 | |
| GPT-5Evaluation Protocol=Agent Workflow2026.04 | 72.28 | |
| MM-DeepResearch 32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 70.1 | |
| SenseNova-MARS-8BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=8B2026.04 | 67.11 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=32B2026.04 | 66.94 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=8B2026.04 | 64.22 | |
| Gemini-3-proEvaluation Protocol=Direct Answer2026.04 | 58.94 | |
| MMSearch-R1-7BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=7B2026.04 | 58.4 | |
| Gemini-2.5-proEvaluation Protocol=Direct Answer2026.04 | 54.5 | |
| GPT-5Evaluation Protocol=Direct Answer2026.04 | 50.83 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Direct Answer, Model Scale=8B2026.04 | 26.94 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Direct Answer, Model Scale=32B2026.04 | 24.81 |