Deep Research Task on BrowseComp
67.6AccuracyDeepSeek-V3.2-Thinking-685B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DeepSeek-V3.2-Thinking-685BModel Category=Large Open-Source Models, Model Size=> 70B2026.02 | 67.6 | — | — | |
| Kimi-K2-Thinking-1TModel Category=Large Open-Source Models, Model Size=> 70B2026.02 | 60.2 | — | — | |
| GPT-5-highModel Category=Closed-Source Models2026.02 | 54.9 | — | — | |
| RE-TRAC-30B-A3BModel Category=Intermediate-sized Open-Source Models, Model Size=15B~70B2026.02 | 53 | — | — | |
| GLM-4.7-358BModel Category=Large Open-Source Models, Model Size=> 70B2026.02 | 52 | — | — | |
| OpenAI DeepResearchModel Category=Closed-Source Models2026.02 | 51.5 | — | — | |
| o3Model Category=Closed-Source Models2026.02 | 49.7 | — | — | |
| MiniMax-M2-229BModel Category=Large Open-Source Models, Model Size=> 70B2026.02 | 44 | — | — | |
| Tongyi-DeepResearch-30B-A3BModel Category=Intermediate-sized Open-Source Models, Model Size=15B~70B2026.02 | 43.4 | — | — | |
| Gemini-3-proModel Category=Closed-Source Models2026.02 | 37.8 | — | — | |
| IterResearch-30B-A3BModel Category=Intermediate-sized Open-Source Models, Model Size=15B~70B2026.02 | 37.3 | — | — | |
| WebSailor-V2-30B-A3B (RL)Model Category=Intermediate-sized Open-Source Models, Model Size=15B~70B2026.02 | 35.3 | — | — | |
| RE-TRAC-4BModel Category=Compact Open-Source Models, Model Size=< 15B2026.02 | 30 | — | — | |
| AgentCPM-Explore-4BModel Category=Compact Open-Source Models, Model Size=< 15B2026.02 | 25 | — | — | |
| Claude-4.5-SonnetModel Category=Closed-Source Models2026.02 | 24.1 | — | — | |
| NestBrowse-4BModel Category=Compact Open-Source Models, Model Size=< 15B2026.02 | 22.4 | — | — | |
| WebExplorer-8BModel Category=Compact Open-Source Models, Model Size=< 15B2026.02 | 15.7 | — | — | |
| InfoAgent-14BModel Category=Compact Open-Source Models, Model Size=< 15B2026.02 | 15.3 | — | — | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=22026.01 | 10 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=32026.01 | 10 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=42026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=52026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=62026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=72026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=82026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=92026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=102026.01 | 9 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=12026.01 | 8 | 4 | 5 | |
| DeepVerifierBackbone=Claude-3.7-Sonnet, # Feedback Rounds=02026.01 | 5 | 4 | 5 |