Mathematical Reasoning on IMO-AnswerBench (Accuracy)
83.8AccuracyQwen3.6 Plus
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.6 PlusParams=N/A2026.06 | 83.8 | |
| Gemini 3 ProParams=N/A2026.06 | 83.1 | |
| GLM-5Params=744B2026.06 | 82.5 | |
| Kimi K2.5Params=1T2026.06 | 81.8 | |
| Qwen3.5-397B-A17BParams=397B2026.06 | 80.9 | |
| VibeThinker-3B + CLRParams=3B, Post-training optimization=CLR2026.06 | 80.6 | |
| Claude Opus 4.5Params=N/A2026.06 | 78.5 | |
| DeepSeek V3.2Params=671B2026.06 | 78.3 | |
| VibeThinker-3BParams=3B2026.06 | 76.4 | |
| GPT-5 (high)Params=N/A2026.06 | 76 | |
| GPT-OSS (high)Params=120B2026.06 | 75.6 | |
| Grok 4Params=N/A2026.06 | 73.1 | |
| Gemini 2.5 ProParams=N/A2026.06 | 68.2 | |
| MiniMax M2.7Params=229B2026.06 | 66.3 | |
| OpenAI o3 (high)Params=N/A2026.06 | 61.1 | |
| DeepSeek R1 0528Params=671B2026.06 | 60.8 |