Open-ended deep research evaluation on DeepResearch Bench 100 PhD-level research tasks
54.25ComprehensivenessFS-Researcher
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| FS-ResearcherCategory=Ours, Backbone=Claude-Sonnet-4.52026.02 | 54.25 | 55.85 | 52.47 | 51.54 | 53.94 | 139.91 | 76.17 | |
| FS-ResearcherCategory=Ours, Backbone=GPT-52026.02 | 51.96 | 54.44 | 52.14 | 51.26 | 52.76 | 113.23 | 60.04 | |
| WebWeaverCategory=Open Source, Backbone=Qwen3-235B-A22B-Instruct-25072026.02 | 51.45 | 51.39 | 50.26 | 48.98 | 50.8 | 152.7 | 75.72 | |
| RhinoInsightCategory=Open Source, Backbone=Gemini-2.5-Pro2026.02 | 50.51 | 51.45 | 51.72 | 50 | 50.92 | — | — | |
| LangChain-Open-Deep-ResearchCategory=Open Source, Backbone=GPT-52026.02 | 50.06 | 50.76 | 51.31 | 49.72 | 50.6 | 22.44 | 34.74 | |
| EnterpriseDeepResearchCategory=Open Source, Backbone=Gemini-2.5-Pro2026.02 | 49.7 | 51.24 | 50.52 | 50.61 | 50.62 | — | 72.5 | |
| Gemini-2.5-Pro-DeepResearchCategory=Proprietary2026.02 | 49.51 | 49.45 | 50.12 | 50 | 49.71 | 165.34 | 78.3 | |
| OpenAI-DeepResearchCategory=Proprietary2026.02 | 46.46 | 43.73 | 49.39 | 47.22 | 46.45 | 39.79 | 75.01 | |
| Claude-DeepResearchCategory=Proprietary2026.02 | 45.34 | 42.79 | 47.58 | 44.66 | 45 | — | — |