Mathematical Reasoning on PRM800K (test)
80AccuracyHRM
Evaluation Results
| Method | Links | |
|---|---|---|
| HRMN=16, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 80 | |
| HRMN=24, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 80 | |
| HRMN=8, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 74.4 | |
| HRMN=2, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 72.2 | |
| HRMN=4, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 71.1 | |
| PRMN=2, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 70 | |
| ORMN=4, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 67.7 | |
| ORMN=8, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 65.5 | |
| ORMN=16, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 65.5 | |
| PRMN=4, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 64.4 | |
| ORMN=24, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 63.3 | |
| ORMN=2, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 62.2 | |
| PRMN=8, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 61.1 | |
| PRMN=16, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 58.8 | |
| PRMN=24, policy_model=Qwen2.5-72B-Math-Instruct, reward_model_training=fine-tuned on manually labeled PRM800K dataset2025.03 | 57.7 |