Expert-Level Reasoning on HLE (text-only subset, val)
52.2Inference AccuracyReThinker
Evaluation Results
| Method | Links | |
|---|---|---|
| ReThinkerModel Category=Inference Frameworks, Backbone=Gemini-3-Pro, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 52.2 | |
| Gemini-3-ProModel Category=Foundation Models with Tools, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 38.3 | |
| GPT-5-highModel Category=Foundation Models with Tools, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 35.2 | |
| MiroThinker-v1.0Model Category=Inference Frameworks, Backbone=30B, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 33.4 | |
| ReThinkerModel Category=Inference Frameworks, Backbone=OpenPangu-72B, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 33.1 | |
| Tongyi DeepResearchModel Category=Inference Frameworks, Backbone=30B-A3B, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 32.9 | |
| GLM-4.6Model Category=Foundation Models with Tools, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 30.4 | |
| DeepSeek-V3.2Model Category=Foundation Models with Tools, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 27.2 | |
| Kimi ResearcherModel Category=Inference Frameworks, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 26.9 | |
| OpenAI DeepResearchModel Category=Inference Frameworks, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 26.6 | |
| Claude-4.5-SonnetModel Category=Foundation Models with Tools, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 24.5 | |
| Kimi K2Model Category=Foundation Models with Tools, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 18.1 | |
| WebExplorerModel Category=Inference Frameworks, Evaluation Protocol=o3-mini-2025-01-31 judge2026.02 | 17.3 |