Deep Research on BrowseComp-ZH (BC-zh) original (test)
58.1Pass@1OpenAI-o3
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenAI-o3Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 58.1 | |
| OpenAI-o3Type=Proprietary Agentic Foundation Model2026.02 | 58.1 | |
| GLM-4.6Type=Open-Source Agentic Foundation Model2026.02 | 49.5 | |
| DeepSeek-V3.1Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 49.2 | |
| DeepSeek-V3.1Type=Open-Source Agentic Foundation Model2026.02 | 49.2 | |
| DeepSeek-V3.2Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 47.9 | |
| MiroThinker-v1.0-30BBackbone=30B, Type=Open-Source Agentic Foundation Model2026.02 | 47.8 | |
| Tongyi-DeepResearchBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 46.7 | |
| Tongyi-DR-30BBackbone=30B, Type=Open-Source Agentic Foundation Model2026.02 | 46.7 | |
| WebSailor-v2-30B-A3B (RL)Backbone Group=Medium Size Deep Research Agents (30B-72B), Training Protocol=RL2026.01 | 44.1 | |
| OpenAI-DeepResearchType=Proprietary Agentic Foundation Model2026.02 | 42.9 | |
| Claude-4.5-SonnetType=Proprietary Agentic Foundation Model2026.02 | 40.8 | |
| QwQ-32B-RFT-Iter2 (SRR-Judge)Backbone=QwQ-32B, Training Strategy=Iterative RFT, Iteration=2, Supervision Type=SRR-Judge2026.02 | 38.3 | |
| DeepSeek-R1 + SRR RefineBackbone=DeepSeek-R1, Refinement Method=SRR Refine2026.02 | 37.8 | |
| DeepSeek-R1Backbone=DeepSeek-R12026.02 | 36.5 | |
| QwQ-32B-RFT-Iter1 (SRR-Judge)Backbone=QwQ-32B, Training Strategy=Iterative RFT, Iteration=1, Supervision Type=SRR-Judge2026.02 | 36.5 | |
| QwQ-32B-RFT-Iter1 (ORM)Backbone=QwQ-32B, Training Strategy=Iterative RFT, Iteration=1, Supervision Type=Outcome Supervision (ORM)2026.02 | 32.8 | |
| QwQ-32B-SFT + SRR RefineBackbone=QwQ-32B, Training Strategy=SFT, Refinement Method=SRR Refine2026.02 | 32 | |
| WebExplorer-8B (RL)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=RL2026.01 | 31.8 | |
| QwQ-32B-SFTBackbone=QwQ-32B, Training Strategy=SFT2026.02 | 31.8 | |
| WebSailor-72BBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 30.1 | |
| DeepDive-32BBackbone=32B, Type=Open-Source Deep Search Solution2026.02 | 29.7 | |
| QwQ-32B + SRR RefineBackbone=QwQ-32B, Refinement Method=SRR Refine2026.02 | 29.2 | |
| Claude-4-SonnetBackbone Group=Large Size Foundation Models (> 100B)2026.01 | 29.1 | |
| Kimi-K2Backbone Group=Large Size Foundation Models (> 100B)2026.01 | 28.8 | |
| WebSailor-v2-30B-A3B (SFT)Backbone Group=Medium Size Deep Research Agents (30B-72B), Training Protocol=SFT2026.01 | 28.3 | |
| OffSeeker-8B (DPO)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=DPO2026.01 | 26.6 | |
| Doubao-DeepThinkType=Proprietary Agentic Foundation Model2026.02 | 26 | |
| WebSailor-32BBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 25.5 | |
| WebSailor-32BBackbone=32B, Type=Open-Source Deep Search Solution2026.02 | 25.5 | |
| OffSeeker-8B (SFT)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=SFT2026.01 | 24.2 | |
| QwQ-32BBackbone=QwQ-32B2026.02 | 23.4 | |
| Kimi-K2-0905Type=Open-Source Agentic Foundation Model2026.02 | 22.2 | |
| WebDancer-QwQBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 18 | |
| WebDancer-32BBackbone=32B, Type=Open-Source Deep Search Solution2026.02 | 18 | |
| Search-O1-32BBackbone=32B, Type=Open-Source Deep Search Solution2026.02 | 17.9 | |
| MiroThinker-32B-DPO-v0.1Backbone Group=Medium Size Deep Research Agents (30B-72B), Training Protocol=DPO2026.01 | 17 | |
| DeepDive-9B (SFT)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=SFT2026.01 | 15.7 | |
| ASearcher-Web-QwQBackbone Group=Medium Size Deep Research Agents (30B-72B)2026.01 | 15.6 | |
| ASearcher-Web-32BBackbone=32B, Type=Open-Source Deep Search Solution2026.02 | 15.6 | |
| DeepDive-9B (RL)Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=RL2026.01 | 15.1 | |
| WebSailor-7BBackbone Group=Small Size Deep Research Agents (< 10B)2026.01 | 14.2 | |
| MiroThinker-8B-DPO-v0.1Backbone Group=Small Size Deep Research Agents (< 10B), Training Protocol=DPO2026.01 | 13.6 | |
| Grok-DeepResearchType=Proprietary Agentic Foundation Model2026.02 | 12.9 | |
| WebThinker-32BBackbone=32B, Type=Open-Source Deep Search Solution2026.02 | 7.3 |