High-Level Reasoning on HLE
26.6Average ScoreOpenAI DeepResearch
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenAI DeepResearch2026.01 | 26.6 | |
| OpenAI-o32026.01 | 20.2 | |
| Claude-4-Sonnet2026.01 | 20.2 | |
| o1-preview2026.01 | 11.1 | |
| Search-o1Backbone=QwQ-32B-Preview2026.01 | 10.8 | |
| Reagent-UBackbone=Qwen3-8B2026.01 | 10.8 | |
| ARPOBackbone=Qwen3-14B2026.01 | 10 | |
| Atom-SearcherBackbone=Qwen2.5-7B2026.01 | 10 | |
| Reagent-RBackbone=Qwen3-8B2026.01 | 10 | |
| ARPOBackbone=Qwen3-8B2026.01 | 8.8 | |
| DeepSeek-R1-671BBackbone=DeepSeek-R1-671B2026.01 | 8.6 | |
| VerlToolBackbone=Qwen3-8B2026.01 | 8.4 | |
| Reagent w/o Agent-RRMBackbone=Qwen3-8B2026.01 | 6.8 | |
| WebThinkerBackbone=Qwen3-8B2026.01 | 6.6 | |
| QwQ-32BBackbone=QwQ-32B2026.01 | 6.4 | |
| Reagent-CBackbone=Qwen3-8B, Inference Type=Direct Inference2026.01 | 4.6 | |
| Qwen3-8BBackbone=Qwen3-8B2026.01 | 4 |