Multimodal Deep Search on MMSrch-Plus
33.51AccuracyGemini-3 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3 ProEvaluation Protocol=Agent Workflow2026.04 | 33.51 | |
| MTA-DeepSearch-32BEvaluation Protocol=Ours, Model Scale=32B2026.04 | 31.93 | |
| GPT-5Evaluation Protocol=Agent Workflow2026.04 | 31.61 | |
| Gemini-2.5 ProEvaluation Protocol=Agent Workflow2026.04 | 30.65 | |
| MTA-DeepSearch-8BEvaluation Protocol=Ours, Model Scale=8B2026.04 | 26.77 | |
| Gemini-3-proEvaluation Protocol=Direct Answer2026.04 | 26.37 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=8B2026.04 | 18.38 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=32B2026.04 | 14.84 | |
| GPT-5Evaluation Protocol=Direct Answer2026.04 | 13.18 | |
| Gemini-2.5-proEvaluation Protocol=Direct Answer2026.04 | 12.22 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Direct Answer, Model Scale=32B2026.04 | 2.25 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Direct Answer, Model Scale=8B2026.04 | 1.29 |