Web Navigation Agentic Reasoning on BrowseComp complete (test)
88.2Avg Success Rate@3MiroThinker-H1
Evaluation Results
| Method | Links | |
|---|---|---|
| MiroThinker-H1Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 88.2 | |
| Gemini-3.1-ProAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 85.9 | |
| Claude-4.6-OpusAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 84 | |
| OpenAI-GPT-5.4Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 82.7 | |
| Qwen3.5-397BAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 78.6 | |
| Kimi-K2.5Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 78.4 | |
| Seed-2.0-ProAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 77.3 | |
| Minimax-M2.5Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 76.3 | |
| GLM-5.0Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 75.9 | |
| MiroThinker-1.7Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 74 | |
| MiroThinker-1.7-miniAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 67.9 | |
| Claude-4.5-OpusAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 67.8 | |
| DeepSeek-V3.2Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 67.6 | |
| Gemini-3.0-ProAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 59.2 | |
| OpenAI-GPT-5Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 54.9 | |
| Tongyi-DeepResearch-30BAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 43.4 |