Deep Research on HLE text-only original (test)
32.9Pass@1Tongyi-DeepResearch
Evaluation Results
| Method | Links | |
|---|---|---|
| Tongyi-DeepResearchBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 32.9 | |
| WebSailor-v2-30B-A3B (RL)Backbone Group=Medium Size Deep Research Agents (30B-72B), Training Protocol=RL2026.01 | 30.6 | |
| DeepSeek-V3.1Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 29.8 | |
| DeepSeek-V3.2Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 27.2 | |
| WebSailor-v2-30B-A3B (SFT)Backbone Group=Medium Size Deep Research Agents (30B-72B), Training Protocol=SFT2026.01 | 23.9 | |
| Claude-4-SonnetBackbone Group=Large Size Foundation Models (> 100B)2026.01 | 20.3 | |
| OpenAI-o3Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 20.2 | |
| Kimi-K2Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 18.1 | |
| OffSeeker-8B (DPO)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=DPO2026.01 | 13.8 | |
| ASearcher-Web-QwQBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 12.5 | |
| WebExplorer-8B (RL)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=RL2026.01 | 12.4 | |
| MiroThinker-32B-DPO-v0.1Backbone Group=Medium Size Deep Research Agents (30B-72B), Training Protocol=DPO2026.01 | 11.8 | |
| OffSeeker-8B (SFT)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=SFT2026.01 | 11.7 |