Long-form deep-research answering on HealthBench
54ScoreOpenAI Deep Research
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenAI Deep ResearchFamily=DR agent2026.05 | 54 | |
| Gemini Deep ResearchFamily=DR agent2026.05 | 52.5 | |
| Tongyi DeepResearch-30B-A3BFamily=Open DR2026.05 | 45.9 | |
| DecomposeR-8BFamily=Ours, Training Stage=SFT + RL2026.05 | 42 | |
| WebThinker-32B-DPOFamily=Open DR2026.05 | 39.4 | |
| DecomposeR-8BFamily=Ours, Training Stage=SFT only2026.05 | 39.1 | |
| WebThinker QwQ-32BFamily=Open DR2026.05 | 36.5 | |
| WebExplorer-8BFamily=Open search2026.05 | 34 | |
| Qwen3-8B + SearchFamily=LLM+search2026.05 | 19.8 | |
| Search-R1-7BFamily=Open search2026.05 | 1.1 | |
| ASearcher-Web-7BFamily=Open Search2026.05 | -13 |