Information Seeking Question Answering on InfoSeek
73.9AccuracyMM-DeepResearch 32B
Evaluation Results
| Method | Links | |
|---|---|---|
| MM-DeepResearch 32BEvaluation Paradigm=Agentic Search2026.03 | 73.9 | |
| MM-DeepResearch-8BEvaluation Paradigm=Agentic Search2026.03 | 72.3 | |
| GPT-5Evaluation Paradigm=RAG Workflow2026.03 | 70.6 | |
| SenseNova-MARS-8BEvaluation Paradigm=Agentic Search2026.03 | 70.1 | |
| GPT-5Evaluation Paradigm=Direct Reasoning2026.03 | 61.7 | |
| GPT-4oEvaluation Paradigm=RAG Workflow2026.03 | 59.5 | |
| MM-DeepResearch-7BEvaluation Paradigm=Agentic Search2026.03 | 58.7 | |
| Qwen3-VL-32BEvaluation Paradigm=Agentic Search2026.03 | 58.5 | |
| MMSearch-R1-7BEvaluation Paradigm=Agentic Search2026.03 | 55.1 | |
| GPT-4oEvaluation Paradigm=Direct Reasoning2026.03 | 52.9 | |
| DeepEyes-v2-7BEvaluation Paradigm=Agentic Search2026.03 | 51.1 | |
| Qwen3-VL-8BEvaluation Paradigm=Agentic Search2026.03 | 50.3 | |
| DeepMMSearch-R1-7BEvaluation Paradigm=Agentic Search2026.03 | 47.5 | |
| Qwen3-VL-8BEvaluation Paradigm=RAG Workflow2026.03 | 46.1 | |
| Visual-ARFT-7BEvaluation Paradigm=Agentic Search2026.03 | 37.9 | |
| Qwen3-VL-32BEvaluation Paradigm=Direct Reasoning2026.03 | 28 | |
| Qwen3-VL-8BEvaluation Paradigm=Direct Reasoning2026.03 | 23.1 |