Deep Research on SQA v2
88.3ScoreDR Tulu-8B (RL)
Evaluation Results
| Method | Links | |
|---|---|---|
| DR Tulu-8B (RL)Model Category=Open Deep Research (Ours), Training Strategy=RL2025.11 | 88.3 | |
| Ai2 ScholarQA - Claude SonnetModel Category=Fixed Pipeline Deep Research2025.11 | 87.7 | |
| OpenAI Deep ResearchModel Category=Closed Deep Research2025.11 | 79.6 | |
| GPT-5 + SearchModel Category=Closed Deep Research2025.11 | 74.8 | |
| DR Tulu-8B (SFT)Model Category=Open Deep Research (Ours), Training Strategy=SFT2025.11 | 72.3 | |
| Gemini 3 Pro + SearchModel Category=Closed Deep Research2025.11 | 69.8 | |
| Perplexity Deep ResearchModel Category=Closed Deep Research2025.11 | 67.3 | |
| GPT-5 + Our SearchModel Category=Closed Deep Research, Search Pipeline=Our Search2025.11 | 61.1 | |
| Qwen3-8B + Our SearchModel Category=Open Deep Research (Ours), Search Pipeline=Our Search2025.11 | 57.2 | |
| WebThinker-32B-DPO (report)Model Category=Fixed Pipeline Deep Research, Mode=report mode2025.11 | 46.7 | |
| Tongyi DeepResearch-30B-A3BModel Category=Open Deep Research Models2025.11 | 46.5 | |
| WebThinker QwQ-32B (report)Model Category=Fixed Pipeline Deep Research, Mode=report mode2025.11 | 45.2 | |
| WebExplorer-8BModel Category=Open Deep Research Models2025.11 | 42.5 | |
| QwQ-32BModel Category=Naive RAG2025.11 | 41.9 | |
| Qwen3-8BModel Category=Naive RAG2025.11 | 40.4 | |
| WebThinker-32B-DPOModel Category=Open Deep Research Models2025.11 | 32.9 | |
| ASearcher-Web-7BModel Category=Open Deep Research Models2025.11 | 26.9 | |
| Search-R1-7BModel Category=Open Deep Research Models2025.11 | 22.2 |