Aggregate Deep Research Performance on SQA, ResearchQA, and DRB v2
68.6Average ScoreOpenAI Deep Research
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenAI Deep ResearchBackbone=o3/o42026.06 | 68.6 | |
| DEEPRUBRIC (140-step, ≈750h)Backbone=Qwen3-8B, Steps=140-step, Compute Cost=≈750h2026.06 | 68.3 | |
| DR Tulu-8B (1900-step, ≈9700h)Backbone=Qwen3-8B, Steps=1900-step, Compute Cost=≈9700h2026.06 | 68.2 | |
| GPT-5 + SearchBackbone=GPT-52026.06 | 67.9 | |
| DEEPRUBRIC (75-step, ≈402h)Backbone=Qwen3-8B, Steps=75-step, Compute Cost=≈402h2026.06 | 67.1 | |
| DR Tulu-8B (1000-step, ≈6000h)Backbone=Qwen3-8B, Steps=1000-step, Compute Cost=≈6000h2026.06 | 66.5 | |
| Ai2 ScholarQABackbone=Claude Sonnet2026.06 | 66.3 | |
| Gemini 3 Pro + SearchBackbone=Gemini 3 Pro2026.06 | 63.5 | |
| Perplexity Deep ResearchBackbone=Proprietary2026.06 | 61.6 | |
| DEEPRUBRIC (SFT)Backbone=Qwen3-8B, Stage=SFT2026.06 | 60.8 | |
| DR Tulu-8B (SFT)Backbone=Qwen3-8B2026.06 | 59.9 | |
| WebThinker-32B-DPO (report)Backbone=Qwen2.5-32B (report)2026.06 | 53.8 | |
| WebThinker (report)Backbone=QwQ-32B (report)2026.06 | 52 | |
| Tongyi DeepResearch-30B-A3BBackbone=Qwen2.5-30B2026.06 | 51.3 | |
| WebExplorer-8BBackbone=Qwen2.5-8B2026.06 | 48 | |
| QwQ-32B + RAGBackbone=QwQ-32B2026.06 | 47.7 | |
| Qwen3-8B + RAGBackbone=Qwen3-8B2026.06 | 43.3 | |
| Qwen3-8B + SearchBackbone=Qwen3-8B2026.06 | 40.6 | |
| WebThinker-32B-DPOBackbone=Qwen2.5-32B2026.06 | 34.9 | |
| Search-R1-7BBackbone=Qwen2.5-7B2026.06 | 19.9 | |
| ASearcher-Web-7BBackbone=Qwen2.5-7B2026.06 | 18 |