Long-form deep research on DeepResearch Bench (test)
48.24Overall ScoreGemini-2.5-Pro Deep Research
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Gemini-2.5-Pro Deep ResearchCategory=Proprietary Agents2026.01 | 48.24 | 48.24 | 47.62 | 48.74 | 48.97 | 85.71 | 27 | |
| OpenAI-DeepResearchCategory=Proprietary Agents2026.01 | 47.2 | 47.07 | 45.84 | 48.98 | 47.64 | 65.3 | 34.15 | |
| Self-ManagerCategory=Single Agent, Base Model=Qwen3-Next-80B-A3B2026.01 | 45.63 | 43.53 | 44.32 | 48.17 | 48.14 | 35.9 | 6.69 | |
| Self-ManagerCategory=Single Agent, Base Model=Qwen3-30B-A3B-25072026.01 | 45.47 | 43.5 | 44.07 | 48.21 | 48.08 | 24.8 | 2.51 | |
| Self-ManagerCategory=Single Agent, Base Model=Qwen3-30B-A3B2026.01 | 44.33 | 43.14 | 42.28 | 47.61 | 45.97 | 25.49 | 2.19 | |
| Langchain-open-DeepResearchCategory=Multi-Agent Workflow2026.01 | 43.89 | 43.61 | 42.19 | 47.3 | 45.07 | 53.52 | 31.17 | |
| Self-ManagerCategory=Single Agent, Base Model=Qwen3-8B2026.01 | 43.88 | 42.3 | 42 | 47.35 | 45.78 | 17.8 | 1.86 | |
| AI-Q NVIDIA Research AssistantCategory=Multi-Agent Workflow2026.01 | 43.69 | 42.07 | 42.76 | 46.15 | 45.14 | — | — | |
| ReSumCategory=Single Agent, Base Model=Qwen3-30B-A3B2026.01 | 42.77 | 41.34 | 40.09 | 46.82 | 45.15 | 32.72 | 2.33 | |
| Claude-3.7-SonnetCategory=LLMs w/ Search2026.01 | 42.29 | 41.45 | 43.78 | 44.53 | 42.23 | 89.51 | 10.39 | |
| Qwen3-30B-A3BCategory=LLMs w/ Search2026.01 | 41.83 | 39.85 | 40.27 | 44.74 | 44.44 | 60.63 | 8.3 | |
| FoldAgentCategory=Single Agent, Base Model=Qwen3-30B-A3B2026.01 | 41.79 | 40.04 | 38.95 | 46.22 | 43.97 | 19.61 | 1.56 | |
| ReActCategory=Single Agent, Base Model=Qwen3-30B-A3B2026.01 | 40.51 | 39.15 | 37.71 | 43.98 | 43.4 | 21.69 | 1.36 |