Multimodal Deep Search on MTA (test)
29.78AccuracyMTA-DeepSearch-32B
Evaluation Results
| Method | Links | |
|---|---|---|
| MTA-DeepSearch-32BEvaluation Protocol=Ours, Model Scale=32B2026.04 | 29.78 | |
| Gemini-3 ProEvaluation Protocol=Agent Workflow2026.04 | 28.65 | |
| Gemini-2.5 ProEvaluation Protocol=Agent Workflow2026.04 | 27.53 | |
| Gemini-3-proEvaluation Protocol=Direct Answer2026.04 | 26.97 | |
| GPT-5Evaluation Protocol=Agent Workflow2026.04 | 25.84 | |
| Gemini-2.5-proEvaluation Protocol=Direct Answer2026.04 | 21.91 | |
| GPT-5Evaluation Protocol=Direct Answer2026.04 | 21.35 | |
| MTA-DeepSearch-8BEvaluation Protocol=Ours, Model Scale=8B2026.04 | 20.79 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=32B2026.04 | 17.42 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=8B2026.04 | 11.8 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Direct Answer, Model Scale=32B2026.04 | 11.24 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Direct Answer, Model Scale=8B2026.04 | 6.18 |