Expert-level Reasoning on Humanity's Last Exam 2,158 text-only
54.2Avg@3 ScoreSeed-2.0-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Seed-2.0-ProAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 54.2 | |
| Claude-4.6-OpusAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 53.1 | |
| OpenAI-GPT-5.4Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 52.1 | |
| Gemini-3.1-ProAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 51.4 | |
| GLM-5.0Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 50.4 | |
| Kimi-K2.5Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 50.2 | |
| Qwen3.5-397BAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 48.3 | |
| MiroThinker-H1Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 47.7 | |
| Gemini-3.0-ProAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 46.9 | |
| Claude-4.5-OpusAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 43.2 | |
| MiroThinker-1.7Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 42.9 | |
| DeepSeek-V3.2Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 40.8 | |
| MiroThinker-1.7-miniAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 36.4 | |
| OpenAI-GPT-5Agent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 35.2 | |
| Tongyi-DeepResearch-30BAgent Style=ReAct, Max interaction turns=200, Judge LLM=o3-mini-2025-01-31, Max episode retries=5, Context management retention=52026.03 | 32.9 |