Deep Research on ResearchQA
79.2ScoreOpenAI Deep Research
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenAI Deep ResearchModel Category=Closed Deep Research, Evaluation Protocol=100-sample subset2025.11 | 79.2 | |
| OpenAI Deep ResearchCategory=Closed Deep Research2026.06 | 79.2 | |
| GPT-5 + SearchModel Category=Closed Deep Research, Evaluation Protocol=100-sample subset2025.11 | 78.2 | |
| GPT-5 + SearchCategory=Closed Deep Research2026.06 | 78.2 | |
| HOTE-8BCategory=Open Evolving Deep Research2026.06 | 76.9 | |
| DR Tulu-8B (RL)Model Category=Open Deep Research (Ours), Training Strategy=RL2025.11 | 75.7 | |
| Perplexity Deep ResearchModel Category=Closed Deep Research, Evaluation Protocol=original author report2025.11 | 75.3 | |
| GSPOCategory=RL Methods2026.06 | 75.1 | |
| Ai2 ScholarQA - Claude SonnetModel Category=Fixed Pipeline Deep Research, Evaluation Protocol=100-sample subset2025.11 | 75 | |
| Ai2 ScholarQA-Claude Sonnet (report)Category=Fixed Pipeline Deep Research2026.06 | 75 | |
| REINFORCE++Category=RL Methods2026.06 | 74.8 | |
| Gemini 3 Pro + SearchModel Category=Closed Deep Research2025.11 | 74.3 | |
| Gemini 3 Pro + SearchCategory=Closed Deep Research2026.06 | 74.3 | |
| DR Tulu-8B-RLCategory=Open Deep Research2026.06 | 74.3 | |
| WebThinker-32B-DPO (report)Model Category=Fixed Pipeline Deep Research2025.11 | 74.2 | |
| WebThinker-32B-DPO (report)Category=Fixed Pipeline Deep Research2026.06 | 74.2 | |
| SPICE-8BCategory=Evolving Methods2026.06 | 73.9 | |
| GRPOCategory=RL Methods2026.06 | 73.5 | |
| Dr. Zero-8BCategory=Evolving Methods2026.06 | 73.2 | |
| WebThinker QwQ-32B (report)Model Category=Fixed Pipeline Deep Research2025.11 | 72.8 | |
| WebThinker QwQ-32B (report)Category=Fixed Pipeline Deep Research2026.06 | 72.8 | |
| Perplexity-Sonar (High)Model Category=Closed Deep Research, Evaluation Protocol=original author report2025.11 | 69.1 | |
| Gemini Deep ResearchModel Category=Closed Deep Research, Evaluation Protocol=original author report2025.11 | 68.5 | |
| DR Tulu-8B (SFT)Model Category=Open Deep Research (Ours), Training Strategy=SFT2025.11 | 68.5 | |
| DR Tulu-8B-SFTCategory=Open Deep Research2026.06 | 68.5 | |
| Tongyi DeepResearch-30B-A3BModel Category=Open Deep Research Models2025.11 | 66.7 | |
| Tongyi DeepResearch-30B-A3BCategory=Open Deep Research Models2026.06 | 66.7 | |
| WebExplorer-8BModel Category=Open Deep Research Models2025.11 | 64.8 | |
| WebExplorer-8BCategory=Open Deep Research Models2026.06 | 64.8 | |
| Claude-Sonnet SearchModel Category=Closed Deep Research, Evaluation Protocol=original author report2025.11 | 64.3 | |
| GPT-5 + Our SearchModel Category=Closed Deep Research2025.11 | 62.8 | |
| QwQ-32BModel Category=Naive RAG2025.11 | 60.9 | |
| Qwen3-8BModel Category=Naive RAG2025.11 | 56.1 | |
| Qwen3-235B-A22BCategory=Open Deep Research Models2026.06 | 50.7 | |
| WebThinker-32B-DPOModel Category=Open Deep Research Models2025.11 | 48.6 | |
| WebThinker-32B-DPOCategory=Open Deep Research Models2026.06 | 48.6 | |
| Qwen3-8B + Our SearchModel Category=Open Deep Research (Ours)2025.11 | 46.3 | |
| Qwen3-8BCategory=Open Deep Research Models2026.06 | 46.3 | |
| Search-R1-7BModel Category=Open Deep Research Models2025.11 | 27.9 | |
| Search-R1-7BCategory=Open Deep Research Models2026.06 | 27.9 | |
| ASearcher-Web-7BModel Category=Open Deep Research Models2025.11 | 19.4 | |
| ASearcher-Web-7BCategory=Open Deep Research Models2026.06 | 19.4 |