Mathematical Reasoning on MATH500 (full)
92.4AccuracyDeepseek-v3-RMoA
Evaluation Results
| Method | Links | |
|---|---|---|
| Deepseek-v3-RMoALayers=6, Proposers=6, Greedy diversity K=3, Temperature=0.7, Max_token=10242025.05 | 92.4 | |
| Deepseek-v3-MoALayers=6, Proposers=6, Greedy diversity K=3, Temperature=0.7, Max_token=10242025.05 | 89.4 | |
| A-UATSPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 88.8 | |
| A-UATSPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 88.55 | |
| Deepseek-v3shot=4-shot2025.05 | 88.2 | |
| Qwen2.5-72B-RMoALayers=6, Proposers=6, Greedy diversity K=3, Temperature=0.7, Max_token=10242025.05 | 87.8 | |
| H-UATSPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 87.72 | |
| A-UATSPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 87.66 | |
| H-UATSPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 87.57 | |
| DoRAPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 86.98 | |
| DoRAPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 86.72 | |
| A-UATSPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 86.54 | |
| DoRAPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 86.33 | |
| H-UATSPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 85.63 | |
| DVTSPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 85.29 | |
| REBASEPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 85.08 | |
| Best-of-NPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 84.93 | |
| REBASEPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 84.83 | |
| A-UATSPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 84.76 | |
| H-UATSPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 84.67 | |
| Best-of-NPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 84.57 | |
| DVTSPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 84.27 | |
| Qwen2.5-72B-MoALayers=6, Proposers=6, Greedy diversity K=3, Temperature=0.7, Max_token=10242025.05 | 84.2 | |
| Beam SearchPolicy=Qwen2.5-Instruct-7B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 84.09 | |
| DVTSPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 83.73 | |
| H-UATSPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 83.4 | |
| DoRAPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 83.39 | |
| REBASEPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 82.79 | |
| Best-of-NPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 82.71 | |
| Beam SearchPolicy=Qwen2.5-Instruct-7B, Reward=Skywork-PRM-1.5B2026.02 | 82.07 | |
| Beam SearchPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 81.69 | |
| DVTSPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 81.56 | |
| A-UATSPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 80.71 | |
| DoRAPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 80.38 | |
| Qwen2.5-72Bshot=4-shot2025.05 | 80 | |
| REBASEPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 79.96 | |
| Best-of-NPolicy=Qwen2.5-Instruct-3B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 79.29 | |
| REBASEPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 79.24 | |
| H-UATSPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 78.7 | |
| Beam SearchPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 78.69 | |
| DVTSPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 78.19 | |
| Beam SearchPolicy=Qwen2.5-Instruct-7B, Reward=Math-Shepherd-PRM-7B2026.02 | 77.88 | |
| Best-of-NPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 77.12 | |
| Best-of-NPolicy=Qwen2.5-Instruct-3B, Reward=Skywork-PRM-1.5B2026.02 | 76.76 | |
| A-UATSPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 75.88 | |
| DoRAPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 74.59 | |
| A-UATSPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 73.96 | |
| H-UATSPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 73.14 | |
| H-UATSPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 72.43 | |
| DVTSPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 72.19 | |
| REBASEPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 71.25 | |
| DoRAPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 71.19 | |
| DVTSPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 70.87 | |
| DoRAPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 70.46 | |
| Beam SearchPolicy=Qwen2.5-Instruct-3B, Reward=Math-Shepherd-PRM-7B2026.02 | 69.88 | |
| DVTSPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 69.26 | |
| REBASEPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 69.11 | |
| Beam SearchPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 68.72 | |
| REBASEPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 67.66 | |
| A-UATSPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 67.64 | |
| A-UATSPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 67.26 | |
| Beam SearchPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 67.12 | |
| A-UATSPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 66.64 | |
| Best-of-NPolicy=Llama3.1-Instruct-8B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 66.12 | |
| Best-of-NPolicy=Llama3.1-Instruct-8B, Reward=Skywork-PRM-1.5B2026.02 | 65.95 | |
| H-UATSPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 65.94 | |
| H-UATSPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 65.4 | |
| DoRAPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 65.09 | |
| H-UATSPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 64.48 | |
| DVTSPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 63.71 | |
| DoRAPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 63.29 | |
| DoRAPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 62.67 | |
| DVTSPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 61.77 | |
| REBASEPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 61.52 | |
| Best-of-NPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 60.95 | |
| Beam SearchPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 60.45 | |
| REBASEPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 60.04 | |
| Beam SearchPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 58.74 | |
| A-UATSPolicy=Llama3.2-Instruct-1B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 58.19 | |
| A-UATSPolicy=Llama3.2-Instruct-1B, Reward=Skywork-PRM-1.5B2026.02 | 58.05 | |
| H-UATSPolicy=Llama3.2-Instruct-1B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 56.57 | |
| H-UATSPolicy=Llama3.2-Instruct-1B, Reward=Skywork-PRM-1.5B2026.02 | 56.27 | |
| DVTSPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 55.59 | |
| REBASEPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 55.45 | |
| Beam SearchPolicy=Llama3.1-Instruct-8B, Reward=Math-Shepherd-PRM-7B2026.02 | 55.38 | |
| DoRAPolicy=Llama3.2-Instruct-1B, Reward=Skywork-PRM-1.5B2026.02 | 55.17 | |
| DoRAPolicy=Llama3.2-Instruct-1B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 55.12 | |
| A-UATSPolicy=Qwen2.5-Instruct-0.5B, Reward=Math-Shepherd-PRM-7B2026.02 | 54.46 | |
| Best-of-NPolicy=Qwen2.5-Instruct-0.5B, Reward=Skywork-PRM-1.5B2026.02 | 53.53 | |
| Best-of-NPolicy=Qwen2.5-Instruct-0.5B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 53.09 | |
| DVTSPolicy=Llama3.2-Instruct-1B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 52.81 | |
| H-UATSPolicy=Qwen2.5-Instruct-0.5B, Reward=Math-Shepherd-PRM-7B2026.02 | 52.57 | |
| DVTSPolicy=Llama3.2-Instruct-1B, Reward=Skywork-PRM-1.5B2026.02 | 52.47 | |
| REBASEPolicy=Llama3.2-Instruct-1B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 51.77 | |
| DoRAPolicy=Qwen2.5-Instruct-0.5B, Reward=Math-Shepherd-PRM-7B2026.02 | 51.3 | |
| REBASEPolicy=Llama3.2-Instruct-1B, Reward=Skywork-PRM-1.5B2026.02 | 50.83 | |
| Beam SearchPolicy=Llama3.2-Instruct-1B, Reward=Qwen2.5-Math-PRM-7B2026.02 | 50.57 | |
| Beam SearchPolicy=Llama3.2-Instruct-1B, Reward=Skywork-PRM-1.5B2026.02 | 49.74 | |
| DVTSPolicy=Qwen2.5-Instruct-0.5B, Reward=Math-Shepherd-PRM-7B2026.02 | 48.87 | |
| REBASEPolicy=Qwen2.5-Instruct-0.5B, Reward=Math-Shepherd-PRM-7B2026.02 | 47.82 |