Deep Research on HealthBench ResearchQA DRB Macro Average
62.8Average ScoreGPT-5 + Search
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5 + SearchCategory=Closed Deep Research2026.06 | 62.8 | |
| OpenAI Deep ResearchCategory=Closed Deep Research2026.06 | 60 | |
| HOTE-8BCategory=Open Evolving Deep Research2026.06 | 59.1 | |
| GSPOCategory=RL Methods2026.06 | 56.6 | |
| Dr. Zero-8BCategory=Evolving Methods2026.06 | 56.3 | |
| REINFORCE++Category=RL Methods2026.06 | 56.2 | |
| DR Tulu-8B-RLCategory=Open Deep Research2026.06 | 56 | |
| GRPOCategory=RL Methods2026.06 | 55.4 | |
| SPICE-8BCategory=Evolving Methods2026.06 | 55.4 | |
| Gemini 3 Pro + SearchCategory=Closed Deep Research2026.06 | 52.9 | |
| WebThinker-32B-DPO (report)Category=Fixed Pipeline Deep Research2026.06 | 51.4 | |
| Tongyi DeepResearch-30B-A3BCategory=Open Deep Research Models2026.06 | 51.2 | |
| WebThinker QwQ-32B (report)Category=Fixed Pipeline Deep Research2026.06 | 49.1 | |
| DR Tulu-8B-SFTCategory=Open Deep Research2026.06 | 48.5 | |
| Ai2 ScholarQA-Claude Sonnet (report)Category=Fixed Pipeline Deep Research2026.06 | 47.7 | |
| WebExplorer-8BCategory=Open Deep Research Models2026.06 | 45.1 | |
| Qwen3-235B-A22BCategory=Open Deep Research Models2026.06 | 31.5 | |
| WebThinker-32B-DPOCategory=Open Deep Research Models2026.06 | 27.7 | |
| Qwen3-8BCategory=Open Deep Research Models2026.06 | 23.5 | |
| Search-R1-7BCategory=Open Deep Research Models2026.06 | 12.4 | |
| ASearcher-Web-7BCategory=Open Deep Research Models2026.06 | 4.7 |