Deep Research on HealthBench
59.5ScoreGPT-5 + Search
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5 + SearchModel Category=Closed Deep Research, Evaluation Protocol=100-sample subset2025.11 | 59.5 | |
| GPT-5 + SearchCategory=Closed Deep Research2026.06 | 59.5 | |
| HOTE-8BCategory=Open Evolving Deep Research2026.06 | 54.4 | |
| OpenAI Deep ResearchModel Category=Closed Deep Research, Evaluation Protocol=100-sample subset2025.11 | 53.8 | |
| OpenAI Deep ResearchCategory=Closed Deep Research2026.06 | 53.8 | |
| DR Tulu-8B (RL)Model Category=Open Deep Research (Ours), Training Strategy=RL2025.11 | 52.8 | |
| Dr. Zero-8BCategory=Evolving Methods2026.06 | 52.1 | |
| GSPOCategory=RL Methods2026.06 | 51 | |
| REINFORCE++Category=RL Methods2026.06 | 50.8 | |
| DR Tulu-8B-RLCategory=Open Deep Research2026.06 | 50.2 | |
| SPICE-8BCategory=Evolving Methods2026.06 | 50.2 | |
| GRPOCategory=RL Methods2026.06 | 49.6 | |
| Tongyi DeepResearch-30B-A3BModel Category=Open Deep Research Models2025.11 | 46.2 | |
| Tongyi DeepResearch-30B-A3BCategory=Open Deep Research Models2026.06 | 46.2 | |
| WebThinker-32B-DPO (report)Model Category=Fixed Pipeline Deep Research2025.11 | 39.4 | |
| WebThinker-32B-DPO (report)Category=Fixed Pipeline Deep Research2026.06 | 39.4 | |
| DR Tulu-8B (SFT)Model Category=Open Deep Research (Ours), Training Strategy=SFT2025.11 | 38.1 | |
| DR Tulu-8B-SFTCategory=Open Deep Research2026.06 | 38.1 | |
| Gemini 3 Pro + SearchModel Category=Closed Deep Research2025.11 | 38 | |
| Gemini 3 Pro + SearchCategory=Closed Deep Research2026.06 | 38 | |
| WebThinker QwQ-32B (report)Model Category=Fixed Pipeline Deep Research2025.11 | 36.5 | |
| WebThinker QwQ-32B (report)Category=Fixed Pipeline Deep Research2026.06 | 36.5 | |
| WebExplorer-8BModel Category=Open Deep Research Models2025.11 | 33.7 | |
| WebExplorer-8BCategory=Open Deep Research Models2026.06 | 33.7 | |
| Ai2 ScholarQA - Claude SonnetModel Category=Fixed Pipeline Deep Research, Evaluation Protocol=100-sample subset2025.11 | 32 | |
| Ai2 ScholarQA-Claude Sonnet (report)Category=Fixed Pipeline Deep Research2026.06 | 32 | |
| GPT-5 + Our SearchModel Category=Closed Deep Research2025.11 | 31.1 | |
| QwQ-32BModel Category=Naive RAG2025.11 | 24.5 | |
| Qwen3-235B-A22BCategory=Open Deep Research Models2026.06 | 21.3 | |
| Qwen3-8BModel Category=Naive RAG2025.11 | 16.5 | |
| WebThinker-32B-DPOModel Category=Open Deep Research Models2025.11 | 11.1 | |
| WebThinker-32B-DPOCategory=Open Deep Research Models2026.06 | 11.1 | |
| Qwen3-8B + Our SearchModel Category=Open Deep Research (Ours)2025.11 | 5.9 | |
| Qwen3-8BCategory=Open Deep Research Models2026.06 | 5.9 | |
| Search-R1-7BModel Category=Open Deep Research Models2025.11 | -0.1 | |
| Search-R1-7BCategory=Open Deep Research Models2026.06 | -0.1 | |
| ASearcher-Web-7BModel Category=Open Deep Research Models2025.11 | -13 | |
| ASearcher-Web-7BCategory=Open Deep Research Models2026.06 | -13 |