Process-outcome alignment on PRIME Chemistry
93.35Outcome ScoreDeepSeek-V3.2-thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepSeek-V3.2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 93.35 | 88.49 | |
| Kimi-K2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 92.46 | 89 | |
| Claude-Sonnet-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 92.2 | 88.11 | |
| Grok-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.82 | 89 | |
| Claude-Opus-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.43 | 86.57 | |
| Qwen3-4B-thinking-2507Category=Open-source Models, Thinking=true2026.02 | 91.3 | 83.76 | |
| GPT-5.2-chatCategory=Closed-source Models, Thinking=false2026.02 | 91.3 | 86.45 | |
| Gemini-2.5-Pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.3 | 90.15 | |
| GPT-5.2-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.3 | 88.49 | |
| Claude-Sonnet-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90.28 | 85.29 | |
| GPT-OSS-120BCategory=Open-source Models, Thinking=false2026.02 | 90.03 | 79.8 | |
| GPT-5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.64 | 88.62 | |
| Claude-Opus-4Category=Closed-source Models, Thinking=false2026.02 | 89.26 | 80.43 | |
| Gemini-3.0-pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.26 | 86.19 | |
| Claude-Opus-4.5Category=Closed-source Models, Thinking=false2026.02 | 89.13 | 79.67 | |
| Seed-1.6-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.13 | 79.8 | |
| CompassVerifier-32BCategory=Verifier Model, Thinking=false2026.02 | 89.13 | 73.66 | |
| GLM-4.6Category=Open-source Models, Thinking=false2026.02 | 89 | 84.91 | |
| Claude-Sonnet-4Category=Closed-source Models, Thinking=false2026.02 | 88.62 | 77.75 | |
| Claude-Sonnet-4.5Category=Closed-source Models, Thinking=false2026.02 | 88.36 | 77.49 | |
| DeepSeek-V3.2Category=Open-source Models, Thinking=false2026.02 | 88.24 | 77.62 | |
| Qwen3-30B-A3BCategory=Open-source Models, Thinking=false2026.02 | 88.24 | 83.38 | |
| GPT-OSS-20BCategory=Open-source Models, Thinking=false2026.02 | 88.24 | 79.8 | |
| SCI-Verifier-4BCategory=Verifier Model, Thinking=false2026.02 | 87.98 | 73.53 | |
| Claude-Opus-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 87.85 | 81.84 | |
| Qwen3-8BCategory=Open-source Models, Thinking=false2026.02 | 87.47 | 77.37 | |
| Qwen3-4BCategory=Open-source Models, Thinking=false2026.02 | 86.57 | 75.83 | |
| Tencent-Qwen2.5-7B-RLVRCategory=Verifier Model, Thinking=false2026.02 | 84.65 | 71.23 | |
| xVerify-9B-CCategory=Verifier Model, Thinking=false2026.02 | 83.89 | 72.55 | |
| GPT-5-chatCategory=Closed-source Models, Thinking=false2026.02 | 82.74 | 68.67 | |
| Qwen3-4B-Instruct-2507Category=Open-source Models, Thinking=false2026.02 | 80.05 | 70.2 | |
| Phi-4Category=Open-source Models, Thinking=false2026.02 | 80.05 | 63.81 | |
| General-VerifierCategory=Verifier Model, Thinking=false2026.02 | 77.49 | 63.04 | |
| Math-VerifyCategory=Rule-based Verifier, Thinking=false2026.02 | 69.69 | 65.47 |