Long-form research on HealthBench
59.5Overall ScoreGPT-5 + Search
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5 + SearchCategory=Closed Deep Research2026.05 | 59.5 | |
| OpenAI Deep ResearchCategory=Closed Deep Research2026.05 | 53.8 | |
| DR Tulu-8B (RL, 1900 steps)Category=Open Deep Research Models, Backbone=8B, Training=RL, Steps=19002026.05 | 50.2 | |
| RubricEM-8B (RL, 1400 steps)Backbone=8B, Training=RL, Steps=14002026.05 | 49.3 | |
| Gemini 3.1 Pro + SearchCategory=Closed Deep Research2026.05 | 47.5 | |
| Tongyi DeepResearch-30B-A3BCategory=Open Deep Research Models, Backbone=30B-A3B2026.05 | 46.2 | |
| WebThinker-32B-DPOCategory=Fixed Pipeline Deep Research, Backbone=32B, Alignment=DPO2026.05 | 39.4 | |
| RubricEM-8B (SFT)Backbone=8B, Training=SFT2026.05 | 39 | |
| DR Tulu-8B (SFT)Category=Open Deep Research Models, Backbone=8B, Training=SFT2026.05 | 38.1 | |
| WebThinker QwQ-32BCategory=Fixed Pipeline Deep Research, Backbone=QwQ-32B2026.05 | 36.5 | |
| WebExplorer-8BCategory=Open Deep Research Models, Backbone=8B2026.05 | 33.7 | |
| Ai2 ScholarQA – Claude SonnetCategory=Fixed Pipeline Deep Research, Backbone=Claude Sonnet2026.05 | 32 | |
| Qwen3-8B + Our SearchBackbone=Qwen3-8B, Search=Our Search2026.05 | 24.5 | |
| Search-R1-7BCategory=Open Deep Research Models, Backbone=R1-7B2026.05 | -0.1 |