Reasoning on Humanity's Last Exam
84.61AccuracyHEART
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HEARTModel=Deepseek-Reasoner2025.09 | 84.61 | 2.22 | |
| CoTModel=Deepseek-Reasoner2025.09 | 81.75 | 1 | |
| Self ReflectionModel=Deepseek-Reasoner2025.09 | 81.68 | 1.99 | |
| WaitModel=Deepseek-Reasoner2025.09 | 80.01 | 1.03 | |
| HEARTModel=Claude 4 Sonnet2025.09 | 59.1 | 0.91 | |
| HEARTModel=Gemini 2.5 Pro2025.09 | 57.32 | 1.19 | |
| HEARTModel=Gemini 2.5 Flash2025.09 | 56.87 | 1.54 | |
| Seed-2.0-ProCategory=Proprietary Agents2026.05 | 54.2 | — | |
| Kimi-K2.6Category=Open-Source Agents2026.05 | 54 | — | |
| Claude-4.6-OpusCategory=Proprietary Agents2026.05 | 53.1 | — | |
| Gemini-3.1-ProCategory=Proprietary Agents2026.05 | 51.4 | — | |
| GLM-5.0Category=Open-Source Agents2026.05 | 50.2 | — | |
| Argus-35B-A3B (Parallel)Category=Parallel Agents, Mode=Parallel2026.05 | 49.8 | — | |
| Qwen3.5-397B-A17BCategory=Open-Source Agents2026.05 | 48.3 | — | |
| DeepSeek-V4-Pro-MaxCategory=Open-Source Agents2026.05 | 48.2 | — | |
| Self ReflectionModel=Gemini 2.5 Flash2025.09 | 46.1 | 1.07 | |
| GPT-5.2Category=Proprietary Agents2026.05 | 45.5 | — | |
| Self ReflectionModel=Claude 4 Sonnet2025.09 | 44.61 | 1.14 | |
| Argus-35B-A3B (Solo)Category=Parallel Agents, Mode=Solo2026.05 | 44.2 | — | |
| Searcher-35B-A3BCategory=Parallel Agents2026.05 | 43.2 | — | |
| MiroThinker-1.7Category=Open-Source Deep Research Agents2026.05 | 42.9 | — | |
| WaitModel=Gemini 2.5 Flash2025.09 | 41.31 | 1.05 | |
| CoTModel=Gemini 2.5 Pro2025.09 | 41.08 | 1 | |
| Self ReflectionModel=Gemini 2.5 Pro2025.09 | 40.9 | 0.99 | |
| WaitModel=Claude 4 Sonnet2025.09 | 40.44 | 1.03 | |
| Qwen3.5-35B-A3BCategory=Open-Source Agents2026.05 | 39.5 | — | |
| WaitModel=Gemini 2.5 Pro2025.09 | 38.3 | 1.05 | |
| CoTModel=Gemini 2.5 Flash2025.09 | 37.38 | 1 | |
| CoTModel=Claude 4 Sonnet2025.09 | 35.69 | 1 | |
| HEARTModel=GPT-5 nano2025.09 | 34.19 | 1.43 | |
| HEARTModel=Gemma3 12b Instruct2025.09 | 33.26 | 1.2 | |
| Tongyi-DeepResearchCategory=Open-Source Deep Research Agents2026.05 | 32.9 | — | |
| WaitModel=Gemma3 12b Instruct2025.09 | 32.73 | 1.14 | |
| Self ReflectionModel=GPT-5 nano2025.09 | 30.27 | 1.15 | |
| WaitModel=GPT-5 nano2025.09 | 28.78 | 1.02 | |
| CoTModel=GPT-5 nano2025.09 | 27.03 | 1 | |
| Self ReflectionModel=Gemma3 12b Instruct2025.09 | 26.83 | 0.91 | |
| OpenAI deep researchProprietary=true2025.02 | 26.6 | — | |
| HEARTModel=Gemma3 4b Instruct2025.09 | 26.54 | 1.14 | |
| Self ReflectionModel=Gemma3 4b Instruct2025.09 | 25.38 | 1.05 | |
| CoTModel=Gemma3 12b Instruct2025.09 | 24.57 | 1 | |
| WaitModel=Gemma3 4b Instruct2025.09 | 24.33 | 1.04 | |
| Agentic ReasoningBackbone=DeepSeek-R12025.02 | 23.8 | — | |
| Perplexity deep researchProprietary=false2025.02 | 21.1 | — | |
| CoTModel=Gemma3 4b Instruct2025.09 | 19.52 | 1 | |
| OpenAI o3-miniProprietary=true, Scale=high2025.02 | 13 | — | |
| VanillaModel=Gemini 2.5 Flash2025.09 | 12.44 | — | |
| VanillaModel=Gemini 2.5 Pro2025.09 | 11.9 | — | |
| VanillaModel=GPT-5 nano2025.09 | 10.6 | — | |
| OpenAI o3-miniProprietary=true, Scale=medium2025.02 | 10.5 | — | |
| VanillaModel=Claude 4 Sonnet2025.09 | 10.03 | — | |
| VanillaModel=Deepseek-Reasoner2025.09 | 9.95 | — | |
| DeepSeek-R1Proprietary=false2025.02 | 9.4 | — | |
| OpenAI o1Proprietary=true2025.02 | 9.1 | — | |
| Gemini ThinkingProprietary=false2025.02 | 6.2 | — | |
| Claude 3.5 SonnetProprietary=true2025.02 | 4.3 | — | |
| VanillaModel=Gemma3 4b Instruct2025.09 | 4.21 | — | |
| Grok-2Proprietary=true2025.02 | 3.8 | — | |
| VanillaModel=Gemma3 12b Instruct2025.09 | 3.67 | — | |
| GPT-4oProprietary=true2025.02 | 3.3 | — |