Multimodal Deep Search on MMSrch
82.94AccuracyGemini-3 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3 ProEvaluation Protocol=Agent Workflow2026.04 | 82.94 | |
| MTA-DeepSearch-32BEvaluation Protocol=Ours, Model Scale=32B2026.04 | 82.35 | |
| MTA-DeepSearch-8BEvaluation Protocol=Ours, Model Scale=8B2026.04 | 79.41 | |
| GPT-5Evaluation Protocol=Agent Workflow2026.04 | 77.65 | |
| Gemini-2.5 ProEvaluation Protocol=Agent Workflow2026.04 | 77.65 | |
| SenseNova-MARS-32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 74.27 | |
| MM-DeepResearch 32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 69 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=32B2026.04 | 68.52 | |
| SenseNova-MARS-8BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=8B2026.04 | 67.84 | |
| Gemini-3-proEvaluation Protocol=Direct Answer2026.04 | 65.88 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=8B2026.04 | 57.06 | |
| Webwatcher-32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 55.3 | |
| MMSearch-R1-7BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=7B2026.04 | 53.8 | |
| Webwatcher-7BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=7B2026.04 | 49.1 | |
| Gemini-2.5-proEvaluation Protocol=Direct Answer2026.04 | 41.76 | |
| GPT-5Evaluation Protocol=Direct Answer2026.04 | 36.47 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Direct Answer, Model Scale=32B2026.04 | 17.65 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Direct Answer, Model Scale=8B2026.04 | 12.35 |