Deep Research on BrowseComp
78.4ScoreKimi-K2.5
Evaluation Results
| Method | Links | |
|---|---|---|
| Kimi-K2.5Size=1T-A32B, Context management=true2026.06 | 78.4 | |
| Seed-2.0-ProSize=-, Context management=true2026.06 | 77.3 | |
| MiniMax-M2.5Size=230B-A10B, Context management=true2026.06 | 76.3 | |
| GLM-5.0Size=744B-A40B, Context management=true2026.06 | 75.9 | |
| Kimi-K2.5-AgentSize=1T-A32B, Context Management Technique=true2026.02 | 74.9 | |
| Kimi-K2.5Model Category=Foundation Models2026.04 | 74.9 | |
| LongCat-Flash-ThinkingSize=560B-A27B, Context Management Technique=true2026.02 | 73.1 | |
| LongCat-Flash-Thinking-2601Size=560B-A27B, Context management=true2026.06 | 73.1 | |
| Step-3.5-FlashSize=196B-A11B, Context management=true2026.06 | 69 | |
| SearchSwarmSize=30B-A3B, Context management=true2026.06 | 68.1 | |
| MiroThinker-1.7-miniSize=30B-A3B, Context management=true2026.06 | 67.9 | |
| Claude-4.5-OpusModel Category=Foundation Models2026.04 | 67.8 | |
| Claude-4.5-OpusSize=-, Context management=false2026.06 | 67.8 | |
| Seed1.8Context Management Technique=false2026.02 | 67.6 | |
| DeepSeek-V3.2Size=671B-A37B, Context Management Technique=true2026.02 | 67.6 | |
| DeepSeek-V3.2Model Category=Foundation Models2026.04 | 67.6 | |
| DeepSeek V3.2Size=671B-A37B, Context management=true2026.06 | 67.6 | |
| GLM-4.7Model Category=Foundation Models2026.04 | 67.5 | |
| GLM-4.7Size=355B-A32B, Context management=true2026.06 | 67.5 | |
| GLM-4.7Size=355B-A32B, Context Management Technique=true2026.02 | 66.6 | |
| GPT-5.2-Thinking-xhighContext Management Technique=false2026.02 | 65.8 | |
| GPT-5.2-ThinkingSize=-, Context management=false2026.06 | 65.8 | |
| MiniMax-M2.1Model Category=Foundation Models2026.04 | 62 | |
| LongSeekerSize=30B-A3B, Context management=true2026.06 | 61.5 | |
| Kimi-K2.5-AgentSize=1T-A32B, Context Management Technique=false2026.02 | 60.6 | |
| Gemini-3-ProModel Category=Foundation Models2026.04 | 59.2 | |
| Gemini-3.0-ProSize=-, Context management=false2026.06 | 59.2 | |
| REDSearcherSize=30B-A3B, Context Management Technique=true2026.02 | 57.4 | |
| RedSearcherSize=30B-A3B, Context management=true2026.06 | 57.4 | |
| LongCat-Flash-ThinkingSize=560B-A27B, Context Management Technique=false2026.02 | 56.6 | |
| MiroThinker-1.5-miniSize=30B-A3B, Context management=true2026.06 | 56.1 | |
| GPT-5-Thinking-highContext Management Technique=false2026.02 | 54.9 | |
| GPT-5 HighModel Category=Foundation Models2026.04 | 54.9 | |
| GPT-5Size=-, Context management=false2026.06 | 54.9 | |
| GLM-4.7Size=355B-A32B, Context Management Technique=false2026.02 | 52 | |
| DeepSeek-V3.2Size=671B-A37B, Context Management Technique=false2026.02 | 51.4 | |
| OpenAI-o3Context Management Technique=false2026.02 | 49.7 | |
| OpenAI-o3Model Category=Foundation Models2026.04 | 49.7 | |
| SMTL-30B-300Model Category=Trained Agents, Model Scale Group=≥30B2026.04 | 48.6 | |
| MiniMax-M2Size=230B-A10B, Context management=false2026.06 | 44 | |
| Tongyi DeepResearch-30BSize=30B-A3B, Context Management Technique=false2026.02 | 43.4 | |
| Tongyi-DR-30BModel Category=Trained Agents, Model Scale Group=≥30B2026.04 | 43.4 | |
| Tongyi DeepResearchSize=30B-A3B, Context management=false2026.06 | 43.4 | |
| Tongyi DR SwarmSize=30B-A3B, Context management=false2026.06 | 43.4 | |
| GLM-4.7-FlashSize=30B-A3B, Context Management Technique=false2026.02 | 42.8 | |
| REDSearcherSize=30B-A3B, Context Management Technique=false2026.02 | 42.1 | |
| REDSearcher-30B-A3BModel Category=Trained Agents, Model Scale Group=≥30B2026.04 | 42.1 | |
| Gemini-3-ProContext Management Technique=false2026.02 | 37.8 | |
| WebResearcher-30BSize=30B-A3B, Context Management Technique=false2026.02 | 37.3 | |
| WebSailorV2-30BSize=30B-A3B, Context Management Technique=false2026.02 | 35.3 | |
| WebSailor-V2-30B-RLModel Category=Trained Agents, Model Scale Group=≥30B, Training Protocol=RL2026.04 | 35.3 | |
| DeepMiner-32B-RLModel Category=Trained Agents, Model Scale Group=≥30B, Training Protocol=RL2026.04 | 33.5 | |
| OpenSeeker-v1-30B-SFTModel Category=Trained Agents, Model Scale Group=≥30B, Training Protocol=SFT2026.04 | 29.5 | |
| DR-Venus-4B-RLModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=RL2026.04 | 29.1 | |
| DR-Venus-4B-SFTModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=SFT2026.04 | 26.8 | |
| OpenResearcher-30B-A3BModel Category=Trained Agents, Model Scale Group=≥30B2026.04 | 26.3 | |
| Claude-4.5-sonnetContext Management Technique=false2026.02 | 24.1 | |
| AgentCPM-Explore-4BModel Category=Trained Agents, Model Scale Group=≤9B2026.04 | 24.1 | |
| Claude-4.5-SonnetSize=-, Context management=false2026.06 | 24.1 | |
| WebExplorer-8B-RLModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=RL2026.04 | 15.7 | |
| DeepDive-32B-RLModel Category=Trained Agents, Model Scale Group=≥30B, Training Protocol=RL2026.04 | 14.8 | |
| OffSeeker-8B-DPOModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=DPO2026.04 | 12.8 | |
| OffSeeker-8B-SFTModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=SFT2026.04 | 10.6 | |
| DeepDive-32B-SFTModel Category=Trained Agents, Model Scale Group=≥30B, Training Protocol=SFT2026.04 | 9.5 | |
| Gemini-2.5-pro-DRContext Management Technique=false2026.02 | 7.6 | |
| WebSailor-7BModel Category=Trained Agents, Model Scale Group=≤9B2026.04 | 6.7 | |
| DeepDive-9B-RLModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=RL2026.04 | 6.3 | |
| DeepDive-9B-SFTModel Category=Trained Agents, Model Scale Group=≤9B, Training Protocol=SFT2026.04 | 5.6 |