Mathematical Reasoning on AIME 2025 (Score)
78.8ScoreQwen 3 VL 32B Think
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen 3 VL 32B ThinkModel Family=Qwen 3, Parameter Count=32B, Thinking Capability=true2025.12 | 78.8 | |
| Olmo 3.1 Think 32BTraining Stage=Final Think 3.1, Model Family=Olmo 3.1, Parameter Count=32B, Thinking Capability=true2025.12 | 78.1 | |
| OR Nemotron 7B2025.12 | 73.1 | |
| Olmo 3 Think (Final 3.0)Training Stage=Final Think 3.0, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 72.5 | |
| Qwen 3 32BModel Family=Qwen 3, Parameter Count=32B, Thinking Capability=false2025.12 | 70.9 | |
| Olmo 3 Think (DPO)Training Stage=DPO, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 70.7 | |
| K2-V2 70B InstructModel Family=K2, Parameter Count=70B, Thinking Capability=false2025.12 | 70.3 | |
| Qwen 3 8B2025.12 | 67.8 | |
| Olmo 3 Think (SFT)Training Stage=SFT, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 66.2 | |
| Olmo 3 7B ThinkStage=Final Think2025.12 | 64.6 | |
| Olmo 3 7B ThinkStage=DPO2025.12 | 62.7 | |
| Qwen 3 VL 8B Think2025.12 | 61.5 | |
| Nemotron Nano 9B v22025.12 | 58.9 | |
| Olmo 3 7B ThinkStage=SFT2025.12 | 57.6 | |
| OpenThinker3 7B2025.12 | 57.2 | |
| DS-R1 32BModel Family=DeepSeek-R1, Parameter Count=32B, Thinking Capability=true2025.12 | 56.3 | |
| DS-R1 Qwen 7B2025.12 | 40.2 |