Long-form Deep Research Report Generation Benchmarks
51.9DeepResearchBench II ScoreClaude-4.6-Sonnet-Thinking
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Claude-4.6-Sonnet-Thinking2026.06 | 51.9 | 46.7 | 60.5 | 53 | |
| UniScientistSize=30B, Train=SFT2026.06 | 48 | 46 | 59.9 | 51.3 | |
| OpenAI-DeepResearch2026.06 | 45.4 | 47 | 59.7 | 50.5 | |
| GPT-5.22026.06 | 45.2 | 49.4 | 59.7 | 51.4 | |
| Kimi-K2.5Size=1T2026.06 | 44.8 | 45.5 | 60.9 | 50.4 | |
| GLM-5Size=744B2026.06 | 44.5 | 46.9 | 63.4 | 51.6 | |
| Qwen3.5-397BSize=397B2026.06 | 44.2 | 45.7 | 58.6 | 49.5 | |
| DeepSeek-V3.2Size=671B2026.06 | 42.8 | 45.6 | 53.5 | 47.3 | |
| Gemini-2.5-Pro-DeepResearch2026.06 | 42 | 48.9 | 61.5 | 51.1 | |
| MiniMax-M2.7Size=230B2026.06 | 41.9 | 46 | 62.5 | 50.1 | |
| S1-DeepResearchSize=32B, Train=SFT2026.06 | 41.7 | 46.5 | 58.7 | 48.7 | |
| Gemini-3.1-Pro-Preview2026.06 | 40.7 | 42.6 | 51 | 44.8 | |
| Doubao-2.0-Pro2026.06 | 39.6 | 53.3 | 50.7 | 47.9 | |
| Tongyi-DeepResearchSize=30B, Train=Mid/SFT/RL2026.06 | 29.9 | — | — | — | |
| Qwen3-235BSize=235B2026.06 | 29.7 | 38.4 | 43.9 | 37.3 | |
| Qwen3-32BSize=32B2026.06 | 27.8 | 36 | 41.7 | 35.2 | |
| Step-DeepResearchSize=32B, Train=Mid/SFT/RL2026.06 | — | — | 61.4 | — |