Chinese Web Navigation Agentic Reasoning on BrowseComp ZH
84.4Avg@3MiroThinker-H1
Evaluation Results
| Method | Links | |
|---|---|---|
| MiroThinker-H1Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 84.4 | |
| Seed-2.0-ProAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 82.4 | |
| MiroThinker-1.7Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 75.3 | |
| GLM-5.0Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 72.7 | |
| MiroThinker-1.7-miniAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 72.3 | |
| Qwen3.5-397BAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 70.3 | |
| Gemini-3.0-ProAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 66.8 | |
| DeepSeek-V3.2Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 65 | |
| OpenAI-GPT-5Agent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 65 | |
| Claude-4.5-OpusAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 62.4 | |
| Tongyi-DeepResearch-30BAgent Style=ReAct, Max interaction turns=300, Judge LLM=gpt-4.1-2025-04-14, Max episode retries=5, Context management retention=52026.03 | 46.7 |