Reasoning on HLE (Score)
64.7ScoreClaude Mythos Preview
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude Mythos PreviewOpen Source=false2025.06 | 64.7 | |
| AGENTORCHESTRA EvolvedOpen Source=true2025.06 | 59.6 | |
| GPT-5.4 ProOpen Source=false2025.06 | 58.7 | |
| Muse Spark (Contemplating)Open Source=false2025.06 | 58.4 | |
| GPT-5.5 ProOpen Source=false2025.06 | 57.2 | |
| AGENTORCHESTRA VanillaOpen Source=true2025.06 | 55.2 | |
| Poetiq Meta-SystemOpen Source=false2025.06 | 55 | |
| Claude Opus 4.7Open Source=false2025.06 | 54.7 | |
| Kimi K2.6 ThinkingOpen Source=true2025.06 | 54 | |
| Gemini 3 Deep ThinkOpen Source=false2025.06 | 53.4 | |
| Claude Opus 4.6Open Source=false2025.06 | 53.1 | |
| Zoom Federated AIOpen Source=false2025.06 | 53 | |
| GPT-5.5Open Source=false2025.06 | 52.2 | |
| GPT-5.4Open Source=false2025.06 | 52.1 | |
| Gemini 3.1 ProOpen Source=false2025.06 | 51.4 | |
| Muse SparkOpen Source=false2025.06 | 50.4 | |
| Kimi K2.5 ThinkingOpen Source=true2025.06 | 50.2 | |
| GPT-5.2 ProOpen Source=false2025.06 | 50 | |
| Claude Sonnet 4.6Open Source=false2025.06 | 49 | |
| DeepSeek-V4-Pro-MaxOpen Source=true2025.06 | 48.2 | |
| Yunjue AgentOpen Source=true2025.06 | 48 | |
| MiMo-V2.5-ProOpen Source=true2025.06 | 48 | |
| Gemini Deep ResearchOpen Source=false2025.06 | 46.4 | |
| Gemini 3 Pro2026.05 | 45.8 | |
| Gemini 3 ProOpen Source=false2025.06 | 45.8 | |
| Claude Opus 4.52026.05 | 43.2 | |
| Quest-35B2026.05 | 37.2 | |
| GPT-52026.05 | 35.2 | |
| Tongyi-DR2026.05 | 32.9 | |
| OpenAI-DR2026.05 | 26.6 | |
| Quest-30B2026.05 | 24.6 | |
| OpenResearcherEvaluation Implementation=Authors' implementation2026.05 | 19.6 | |
| DeepSeek v3.22025.12 | 17.9 | |
| Confident DecodingModel=Qwen3.5-27B, Decoding Method=Confident2026.06 | 17 | |
| Confident DecodingModel=Qwen3.5-122B-A10B, Decoding Method=Confident2026.06 | 16.5 | |
| Last Layer DecodingModel=Qwen3.5-27B, Decoding Method=Last Layer2026.06 | 16 | |
| Nemotron-3-Puzzle-75B-A9BModel=Nemotron-3-Puzzle-75B-A9B, Precision=FP8, Tool Use=no tools2026.07 | 16 | |
| DeepSeek R1 05282025.12 | 15.9 | |
| GLM-4.52025.12 | 14.8 | |
| Last Layer DecodingModel=Qwen3.5-122B-A10B, Decoding Method=Last Layer2026.06 | 14.7 | |
| INTELLECT-3Parameters=100B+2025.12 | 14.6 | |
| GLM-4.5-Air2025.12 | 13.3 | |
| GLM-4.6Reported by AA Index=true2025.12 | 13.3 | |
| Confident DecodingModel=gpt-oss-120B, Decoding Method=Confident2026.06 | 12.6 | |
| Confident DecodingModel=Gemma-4-31B, Decoding Method=Confident2026.06 | 11 | |
| Last Layer DecodingModel=gpt-oss-120B, Decoding Method=Last Layer2026.06 | 10.8 | |
| GPT-OSSParameters=120B2025.12 | 10.6 | |
| Confident DecodingModel=Qwen3.5-35B-A3B, Decoding Method=Confident2026.06 | 9.5 | |
| Last Layer DecodingModel=Gemma-4-31B, Decoding Method=Last Layer2026.06 | 9.2 | |
| Last Layer DecodingModel=Qwen3.5-35B-A3B, Decoding Method=Last Layer2026.06 | 7.1 | |
| Confident DecodingModel=gpt-oss-20b, Decoding Method=Confident2026.06 | 6.4 | |
| Confident DecodingModel=Qwen3.5-9B-Base, Decoding Method=Confident2026.06 | 6.3 | |
| Confident DecodingModel=Qwen3.5-9B, Decoding Method=Confident2026.06 | 6.1 | |
| Ouro-2.6B-Thinking-R4Parameters=2.6B, Configuration=Thinking-R42025.10 | 5.58 | |
| Last Layer DecodingModel=gpt-oss-20b, Decoding Method=Last Layer2026.06 | 5.5 | |
| Last Layer DecodingModel=Qwen3.5-9B-Base, Decoding Method=Last Layer2026.06 | 5.4 | |
| Ouro-1.4B-Thinking-R4Parameters=1.4B, Configuration=Thinking-R42025.10 | 5.21 | |
| Qwen3-4BParameters=4B2025.10 | 5.21 | |
| Last Layer DecodingModel=Qwen3.5-9B, Decoding Method=Last Layer2026.06 | 5.2 | |
| Deepseek-Distill-Qwen-7BParameters=7B2025.10 | 5.14 | |
| Deepseek-Distill-Qwen-1.5BParameters=1.5B2025.10 | 4.2 | |
| Qwen3-1.7BParameters=1.7B2025.10 | 4.13 | |
| Qwen3-8BParameters=8B2025.10 | 2.22 | |
| Last Layer DecodingModel=Qwen3.5-0.8B, Decoding Method=Last Layer2026.06 | 0 | |
| Confident DecodingModel=Qwen3.5-0.8B, Decoding Method=Confident2026.06 | 0 |