Process-outcome alignment on PRIME Biology
91.94Outcome ScoreGemini-2.5-Pro-thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5-Pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 91.94 | 91.44 | |
| GPT-5.2-chatCategory=Closed-source Models, Thinking=false2026.02 | 91.44 | 89.42 | |
| DeepSeek-V3.2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 91.18 | 90.43 | |
| SCI-Verifier-4BCategory=Verifier Model, Thinking=false2026.02 | 91.18 | 84.38 | |
| Qwen3-4B-thinking-2507Category=Open-source Models, Thinking=true2026.02 | 90.68 | 86.65 | |
| Claude-Sonnet-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90.43 | 88.66 | |
| Qwen3-30B-A3BCategory=Open-source Models, Thinking=false2026.02 | 90.18 | 87.66 | |
| Grok-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 90.18 | 89.42 | |
| GPT-5.2-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 89.92 | 89.17 | |
| GPT-OSS-20BCategory=Open-source Models, Thinking=false2026.02 | 89.67 | 85.14 | |
| Kimi-K2-thinkingCategory=Open-source Models, Thinking=true2026.02 | 89.67 | 87.66 | |
| GPT-OSS-120BCategory=Open-source Models, Thinking=false2026.02 | 88.92 | 85.14 | |
| CompassVerifier-32BCategory=Verifier Model, Thinking=false2026.02 | 88.66 | 81.36 | |
| Claude-Opus-4Category=Closed-source Models, Thinking=false2026.02 | 88.41 | 84.89 | |
| Claude-Opus-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 88.41 | 86.65 | |
| GPT-5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 88.16 | 88.16 | |
| DeepSeek-V3.2Category=Open-source Models, Thinking=false2026.02 | 87.91 | 84.63 | |
| Qwen3-8BCategory=Open-source Models, Thinking=false2026.02 | 87.91 | 84.13 | |
| GLM-4.6Category=Open-source Models, Thinking=false2026.02 | 87.66 | 84.38 | |
| Claude-Opus-4.5Category=Closed-source Models, Thinking=false2026.02 | 86.65 | 81.86 | |
| Claude-Sonnet-4-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 86.65 | 85.39 | |
| Seed-1.6-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 86.65 | 82.87 | |
| xVerify-9B-CCategory=Verifier Model, Thinking=false2026.02 | 86.39 | 80.1 | |
| Gemini-3.0-pro-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 86.15 | 85.39 | |
| Claude-Opus-4.5-thinkingCategory=Closed-source Models, Thinking=true2026.02 | 85.64 | 85.14 | |
| Tencent-Qwen2.5-7B-RLVRCategory=Verifier Model, Thinking=false2026.02 | 85.14 | 78.34 | |
| Qwen3-4BCategory=Open-source Models, Thinking=false2026.02 | 84.89 | 82.12 | |
| Claude-Sonnet-4Category=Closed-source Models, Thinking=false2026.02 | 84.63 | 81.61 | |
| Claude-Sonnet-4.5Category=Closed-source Models, Thinking=false2026.02 | 83.88 | 79.6 | |
| GPT-5-chatCategory=Closed-source Models, Thinking=false2026.02 | 83.12 | 77.33 | |
| Qwen3-4B-Instruct-2507Category=Open-source Models, Thinking=false2026.02 | 77.33 | 74.56 | |
| Phi-4Category=Open-source Models, Thinking=false2026.02 | 76.57 | 69.52 | |
| General-VerifierCategory=Verifier Model, Thinking=false2026.02 | 75.57 | 68.77 | |
| Math-VerifyCategory=Rule-based Verifier, Thinking=false2026.02 | 73.8 | 72.04 |