Multimodal Deep Search on BC-VL
57.6AccuracyGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5Evaluation Setting=Agent Workflow2026.05 | 57.6 | |
| MTA-DeepSearch-32BEvaluation Protocol=Ours, Model Scale=32B2026.04 | 53.77 | |
| Gemini-3 ProEvaluation Protocol=Agent Workflow2026.04 | 51.78 | |
| GPT-5Evaluation Protocol=Agent Workflow2026.04 | 51.63 | |
| Claude-3.7-SonnetEvaluation Setting=Agent Workflow2026.05 | 50.4 | |
| Gemini-2.5 ProEvaluation Protocol=Agent Workflow2026.04 | 49.5 | |
| Claude-4-SonnetEvaluation Setting=Agent Workflow2026.05 | 48.6 | |
| Qwen3-VL-30B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 46.1 | |
| MTA-DeepSearch-8BEvaluation Protocol=Ours, Model Scale=8B2026.04 | 44.36 | |
| Gemini-2.5 ProEvaluation Setting=Direct Reasoning2026.05 | 43.1 | |
| Qwen3-VL-30B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 43.1 | |
| MM-DeepResearch 32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 43 | |
| GPT-5Evaluation Setting=Direct Reasoning2026.05 | 42.9 | |
| Gemini-2.5 ProEvaluation Setting=Agent Workflow2026.05 | 42.3 | |
| Qwen3-VL-8B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 41.9 | |
| GPT-5Evaluation Protocol=Direct Answer2026.04 | 41.6 | |
| Gemini-3-proEvaluation Protocol=Direct Answer2026.04 | 41.35 | |
| Gemini-2.5-proEvaluation Protocol=Direct Answer2026.04 | 39.85 | |
| Qwen3-VL-8B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 39.6 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=32B2026.04 | 38.69 | |
| Gemini-2.5 FlashEvaluation Setting=Agent Workflow2026.05 | 38.1 | |
| Gemini-2.5 FlashEvaluation Setting=Direct Reasoning2026.05 | 37.1 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Agent Workflow, Model Scale=8B2026.04 | 35.89 | |
| Qwen3-VL-30BEvaluation Setting=Visual-Native Agent Harness2026.05 | 32.8 | |
| Claude-3.7-SonnetEvaluation Setting=Direct Reasoning2026.05 | 32.3 | |
| Qwen3-VL-30BEvaluation Setting=Direct Reasoning2026.05 | 29.6 | |
| Claude-4-SonnetEvaluation Setting=Direct Reasoning2026.05 | 29.3 | |
| Qwen3-VL-30BEvaluation Setting=Agent Workflow2026.05 | 29.3 | |
| Webwatcher-32BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=32B2026.04 | 26.7 | |
| WebWatcher-32BEvaluation Setting=Deep Search Agent2026.05 | 26.7 | |
| Qwen3-VL-8BEvaluation Setting=Visual-Native Agent Harness2026.05 | 26.1 | |
| Qwen3-VL-8BEvaluation Setting=Direct Reasoning2026.05 | 25.1 | |
| Qwen3-VL-32B-Inst.Evaluation Protocol=Direct Answer, Model Scale=32B2026.04 | 24.81 | |
| Qwen3-VL-8BEvaluation Setting=Agent Workflow2026.05 | 24.3 | |
| Webwatcher-7BEvaluation Protocol=Multimodal Deep Search Agents, Model Scale=7B2026.04 | 20.3 | |
| WebWatcher-7BEvaluation Setting=Deep Search Agent2026.05 | 20.3 | |
| Qwen3-VL-8B-Inst.Evaluation Protocol=Direct Answer, Model Scale=8B2026.04 | 20.05 |