Research Report Generation on DeepResearch Bench 1.0 (test)
49.71Overall Scoregemini-2.5-pro-deepresearch
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| gemini-2.5-pro-deepresearchmodel=gemini-2.5-pro-deepresearch2025.12 | 49.71 | 49.51 | 49.45 | 50.12 | 50 | |
| openai-deep-researchmodel=openai-deep-research2025.12 | 46.45 | 46.46 | 43.73 | 49.39 | 47.22 | |
| claude-researchmodel=claude-research2025.12 | 45 | 45.34 | 42.79 | 47.58 | 44.66 | |
| static-dra (gemini-2.5-pro)backbone=gemini-2.5-pro, depth=2, breadth=52025.12 | 34.72 | 35.12 | 30.45 | 38.86 | 35.44 | |
| gemini-2.5-pro-preview-05-06model=gemini-2.5-pro-preview-05-062025.12 | 31.9 | 31.75 | 24.61 | 40.24 | 32.76 | |
| gpt-4o-search-previewmodel=gpt-4o-search-preview2025.12 | 30.74 | 27.81 | 20.44 | 41.01 | 37.6 | |
| sonarmodel=sonar2025.12 | 30.64 | 27.14 | 21.62 | 40.7 | 37.46 |