Mathematical Reasoning on MATH (Score)
96.7ScoreQwen 3 VL 32B Think
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen 3 VL 32B ThinkModel Family=Qwen 3, Parameter Count=32B, Thinking Capability=true2025.12 | 96.7 | |
| Olmo 3.1 Think 32BTraining Stage=Final Think 3.1, Model Family=Olmo 3.1, Parameter Count=32B, Thinking Capability=true2025.12 | 96.2 | |
| Olmo 3 Think (Final 3.0)Training Stage=Final Think 3.0, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 96.1 | |
| Olmo 3 Think (DPO)Training Stage=DPO, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 95.9 | |
| Olmo 3 Think (SFT)Training Stage=SFT, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 95.6 | |
| Qwen 3 32BModel Family=Qwen 3, Parameter Count=32B, Thinking Capability=false2025.12 | 95.4 | |
| Qwen 3 VL 8B Think2025.12 | 95.2 | |
| Olmo 3 7B ThinkStage=Final Think2025.12 | 95.1 | |
| Qwen 3 8B2025.12 | 95.1 | |
| OR Nemotron 7B2025.12 | 94.6 | |
| K2-V2 70B InstructModel Family=K2, Parameter Count=70B, Thinking Capability=false2025.12 | 94.5 | |
| OpenThinker3 7B2025.12 | 94.5 | |
| Olmo 3 7B ThinkStage=SFT2025.12 | 94.4 | |
| Nemotron Nano 9B v22025.12 | 94.4 | |
| DS-R1 32BModel Family=DeepSeek-R1, Parameter Count=32B, Thinking Capability=true2025.12 | 92.6 | |
| Olmo 3 7B ThinkStage=DPO2025.12 | 92.4 | |
| DS-R1 Qwen 7B2025.12 | 87.9 | |
| GHS-TDABackbone=Llama 3-8B2026.02 | 77.19 | |
| AoTBackbone=Llama 3-8B2026.02 | 76.91 | |
| GoTBackbone=Llama 3-8B2026.02 | 76.36 | |
| ToTBackbone=Llama 3-8B2026.02 | 72.86 | |
| CoTBackbone=Llama 3-8B2026.02 | 72.04 | |
| GHS-TDABackbone=Qwen 2-14B2026.02 | 68.4 | |
| AoTBackbone=Qwen 2-14B2026.02 | 66.2 | |
| GoTBackbone=Qwen 2-14B2026.02 | 65.7 | |
| ToTBackbone=Qwen 2-14B2026.02 | 65 | |
| CoTBackbone=Qwen 2-14B2026.02 | 60.8 | |
| LLM-in-Sandbox-RLBackbone=Qwen3-4B-Instruct-2507, Sandbox Mode=true2026.01 | 53.3 | |
| LLM-in-Sandbox-RLBackbone=Qwen3-4B-Instruct-2507, Sandbox Mode=false2026.01 | 51 | |
| LLM-RLBackbone=Qwen3-4B-Instruct-2507, Sandbox Mode=false2026.01 | 48.5 | |
| Base LLMBackbone=Qwen3-4B-Instruct-2507, Sandbox Mode=false2026.01 | 46 | |
| Qwen2-7BParameters=7B2024.07 | 44.2 | |
| LLM-in-Sandbox-RLBackbone=Qwen3-Coder-30B-A3B, Sandbox Mode=true2026.01 | 42.7 | |
| Base LLMBackbone=Qwen3-Coder-30B-A3B, Sandbox Mode=true2026.01 | 41.5 | |
| LLM-RLBackbone=Qwen3-Coder-30B-A3B, Sandbox Mode=true2026.01 | 40.9 | |
| LLM-RLBackbone=Qwen3-4B-Instruct-2507, Sandbox Mode=true2026.01 | 33.1 | |
| Base LLMBackbone=Qwen3-4B-Instruct-2507, Sandbox Mode=true2026.01 | 32.5 | |
| LLM-in-Sandbox-RLBackbone=Qwen3-Coder-30B-A3B, Sandbox Mode=false2026.01 | 29.8 | |
| LLM-RLBackbone=Qwen3-Coder-30B-A3B, Sandbox Mode=false2026.01 | 28.1 | |
| Base LLMBackbone=Qwen3-Coder-30B-A3B, Sandbox Mode=false2026.01 | 26 | |
| Gemma-7BParameters=7B2024.07 | 24.3 | |
| Llama-3-8BParameters=8B2024.07 | 20.5 | |
| Qwen1.5-7BParameters=7B2024.07 | 20.3 | |
| Mistral-7BParameters=7B2024.07 | 13.1 | |
| Phi-42026.01 | 0.801 | |
| Llama-3.3-70B-InstructParameters=70B2026.01 | 0.739 | |
| Llama-3.1-8B-InstructParameters=8B2026.01 | 0.479 | |
| Foundation-Sec-8B-InstructParameters=8B2026.01 | 0.436 | |
| Foundation-Sec-8B-ReasoningParameters=8B2026.01 | 0.433 | |
| Llama-Primus-Merged2026.01 | 0.398 |