Process-outcome alignment on PRIME Physics
92.41Outcome ScoreGPT-5.2-thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5.2-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 92.41 | 89.96 | |
| GPT-5.2-chatCategory=Closed-source Models, Thinking=false2026.02 | 92.19 | 88.17 | |
| Gemini-2.5-Pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.52 | 88.17 | |
| Claude-Sonnet-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.07 | 89.96 | |
| Claude-Opus-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.07 | 87.28 | |
| GPT-5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90.85 | 89.96 | |
| Kimi-K2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 90.4 | 87.05 | |
| Claude-Opus-4.5Category=Closed-source Models, Thinking=false2026.02 | 90.18 | 81.47 | |
| DeepSeek-V3.2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 89.73 | 87.72 | |
| Claude-Sonnet-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.73 | 85.94 | |
| Claude-Opus-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.73 | 86.61 | |
| Qwen3-4B-thinking-2507Category=Open-source Models, Thinking=true2026.02 | 89.51 | 82.81 | |
| GLM-4.6Category=Open-source Models, Thinking=false2026.02 | 89.51 | 85.27 | |
| Grok-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.51 | 87.72 | |
| GPT-OSS-20BCategory=Open-source Models, Thinking=false2026.02 | 88.62 | 83.26 | |
| CompassVerifier-32BCategory=Verifier Model, Thinking=false2026.02 | 88.62 | 77.46 | |
| GPT-OSS-120BCategory=Open-source Models, Thinking=false2026.02 | 88.39 | 82.37 | |
| Claude-Sonnet-4Category=Closed-source Models, Thinking=false2026.02 | 88.39 | 80.58 | |
| Claude-Opus-4Category=Closed-source Models, Thinking=false2026.02 | 88.39 | 81.47 | |
| Gemini-3.0-pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 88.39 | 85.49 | |
| Qwen3-8BCategory=Open-source Models, Thinking=false2026.02 | 88.17 | 80.13 | |
| Qwen3-4BCategory=Open-source Models, Thinking=false2026.02 | 87.72 | 79.46 | |
| Seed-1.6-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 87.72 | 79.91 | |
| DeepSeek-V3.2Category=Open-source Models, Thinking=false2026.02 | 87.5 | 79.02 | |
| Qwen3-30B-A3BCategory=Open-source Models, Thinking=false2026.02 | 87.28 | 83.26 | |
| SCI-Verifier-4BCategory=Verifier Model, Thinking=false2026.02 | 87.05 | 77.68 | |
| Claude-Sonnet-4.5Category=Closed-source Models, Thinking=false2026.02 | 86.83 | 79.69 | |
| GPT-5-chatCategory=Closed-source Models, Thinking=false2026.02 | 86.61 | 77.23 | |
| Tencent-Qwen2.5-7B-RLVRCategory=Verifier Model, Thinking=false2026.02 | 82.14 | 72.77 | |
| xVerify-9B-CCategory=Verifier Model, Thinking=false2026.02 | 81.92 | 73.44 | |
| Phi-4Category=Open-source Models, Thinking=false2026.02 | 81.7 | 70.09 | |
| General-VerifierCategory=Verifier Model, Thinking=false2026.02 | 78.57 | 68.53 | |
| Qwen3-4B-Instruct-2507Category=Open-source Models, Thinking=false2026.02 | 78.35 | 68.97 | |
| Math-VerifyCategory=Rule-based Verifier, Thinking=false2026.02 | 63.17 | 65.85 |