Textual long-horizon complex reasoning on BrowseComp
85.9ScoreGemini-3.1-Pro-Preview
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3.1-Pro-PreviewSize=-, Train=-2026.06 | 85.9 | |
| Qwen3.5-397BSize=397B, Train=-2026.06 | 78.6 | |
| Doubao-2.0-ProSize=-, Train=-2026.06 | 77.3 | |
| MiniMax-M2.7Size=230B, Train=-2026.06 | 76.1 | |
| GLM-5Size=744B, Train=-2026.06 | 75.9 | |
| Kimi-K2.5Size=1T, Train=-2026.06 | 74.9 | |
| Claude-4.6-Sonnet-ThinkingSize=-, Train=-2026.06 | 74.7 | |
| MiroThinker-1.7Size=235B, Train=Mid/SFT/RL2026.06 | 74 | |
| MiroThinker-1.7-miniSize=30B, Train=Mid/SFT/RL2026.06 | 67.9 | |
| GPT-5.2Size=-, Train=-2026.06 | 65.8 | |
| DeepSeek-V3.2Size=671B, Train=-2026.06 | 51.4 | |
| Tongyi-DeepResearchSize=30B, Train=Mid/SFT/RL2026.06 | 43.4 | |
| REDSearcherSize=30B, Train=Mid/SFT/RL2026.06 | 42.1 | |
| S1-DeepResearchSize=32B, Train=SFT2026.06 | 36.7 | |
| OpenSeeker-v1Size=30B, Train=SFT2026.06 | 29.5 | |
| OpenResearcherSize=30B, Train=SFT2026.06 | 26.3 | |
| Qwen3-235BSize=235B, Train=-2026.06 | 11.5 | |
| Qwen3-32BSize=32B, Train=-2026.06 | 3.2 |