Process-outcome alignment on PRIME Math
92.44Outcome ScoreClaude-Sonnet-4.5-thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude-Sonnet-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 92.44 | 81 | |
| Gemini-2.5-Pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 92.11 | 86.11 | |
| GPT-5.2-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 92.11 | 86 | |
| Kimi-K2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 91.78 | 82.56 | |
| Claude-Opus-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.59 | 80.89 | |
| Grok-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.33 | 85.78 | |
| GPT-OSS-120BCategory=Open-source Models, Thinking=false2026.02 | 91.22 | 78.33 | |
| GPT-5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.11 | 86.67 | |
| Claude-Opus-4.5Category=Closed-source Models, Thinking=false2026.02 | 90.89 | 75.67 | |
| GPT-5.2-chatCategory=Closed-source Models, Thinking=false2026.02 | 90.78 | 81.89 | |
| Claude-Sonnet-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90.78 | 81 | |
| DeepSeek-V3.2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 90.67 | 83.89 | |
| Gemini-3.0-pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90.56 | 81.67 | |
| Qwen3-30B-A3BCategory=Open-source Models, Thinking=false2026.02 | 90.44 | 79.67 | |
| GLM-4.6Category=Open-source Models, Thinking=false2026.02 | 90.22 | 81 | |
| Claude-Sonnet-4.5Category=Closed-source Models, Thinking=false2026.02 | 90.22 | 74 | |
| Seed-1.6-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90 | 74.78 | |
| GPT-OSS-20BCategory=Open-source Models, Thinking=false2026.02 | 89.67 | 75.56 | |
| Claude-Sonnet-4Category=Closed-source Models, Thinking=false2026.02 | 89.44 | 74.78 | |
| Claude-Opus-4Category=Closed-source Models, Thinking=false2026.02 | 89.33 | 75.33 | |
| Qwen3-4B-thinking-2507Category=Open-source Models, Thinking=true2026.02 | 89.22 | 76.22 | |
| Claude-Opus-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 88.89 | 79.33 | |
| CompassVerifier-32BCategory=Verifier Model, Thinking=false2026.02 | 88.33 | 67.33 | |
| GPT-5-chatCategory=Closed-source Models, Thinking=false2026.02 | 88.11 | 71.11 | |
| Qwen3-8BCategory=Open-source Models, Thinking=false2026.02 | 87.78 | 72.89 | |
| DeepSeek-V3.2Category=Open-source Models, Thinking=false2026.02 | 87.56 | 72.44 | |
| SCI-Verifier-4BCategory=Verifier Model, Thinking=false2026.02 | 87.56 | 68.78 | |
| xVerify-9B-CCategory=Verifier Model, Thinking=false2026.02 | 87.11 | 67.44 | |
| Qwen3-4BCategory=Open-source Models, Thinking=false2026.02 | 86.33 | 69.56 | |
| Tencent-Qwen2.5-7B-RLVRCategory=Verifier Model, Thinking=false2026.02 | 86.22 | 66.33 | |
| Phi-4Category=Open-source Models, Thinking=false2026.02 | 81.44 | 60 | |
| Qwen3-4B-Instruct-2507Category=Open-source Models, Thinking=false2026.02 | 81.22 | 64.78 | |
| General-VerifierCategory=Verifier Model, Thinking=false2026.02 | 76.78 | 57.78 | |
| Math-VerifyCategory=Rule-based Verifier, Thinking=false2026.02 | 65.56 | 63.67 |