Multimodal Deep Search on MMBC
13.8AccuracyGemini-2.5 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5 ProEvaluation Setting=Agent Workflow2026.05 | 13.8 | |
| Qwen3-VL-8B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 12.5 | |
| Gemini-2.5 FlashEvaluation Setting=Agent Workflow2026.05 | 11.6 | |
| GPT-5Evaluation Setting=Direct Reasoning2026.05 | 11.2 | |
| Qwen3-VL-30B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 11.2 | |
| Gemini-2.5 ProEvaluation Setting=Direct Reasoning2026.05 | 10.3 | |
| Qwen3-VL-30B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 10.3 | |
| Qwen3-VL-8B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 8.5 | |
| Qwen3-VL-8BEvaluation Setting=Visual-Native Agent Harness2026.05 | 7.6 | |
| Qwen3-VL-30BEvaluation Setting=Visual-Native Agent Harness2026.05 | 7.1 | |
| Qwen3-VL-8BEvaluation Setting=Agent Workflow2026.05 | 6.2 | |
| Qwen3-VL-30BEvaluation Setting=Agent Workflow2026.05 | 6.2 | |
| Gemini-2.5 FlashEvaluation Setting=Direct Reasoning2026.05 | 4.9 | |
| Qwen3-VL-30BEvaluation Setting=Direct Reasoning2026.05 | 4.5 | |
| Qwen3-VL-8BEvaluation Setting=Direct Reasoning2026.05 | 4 |