Mathematical Reasoning on Minerva-Math (Last, Best)
49.63Last ScoreHT-MNPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HT-MNPOReward Model=Skywork-Reward-V22025.09 | 49.63 | — | |
| HT-MNPOReward Model=ArmoRM-Llama32025.09 | 47.79 | — | |
| SPPO2025.09 | 47.43 | — | |
| HT-MNPOReward Model=Athene-RM-8B2025.09 | 47.06 | — | |
| INPO2025.09 | 46.32 | — | |
| DPO2025.09 | 45.96 | — | |
| TD-MNPO2025.09 | 44.85 | — | |
| SFT Model2025.09 | 44.12 | — | |
| SimPO2025.09 | 43.38 | — | |
| REINFORCE++Context Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.1691 | 0.1728 | |
| RPG-URKLContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.1654 | 0.1654 | |
| RPG-UFKLContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.1397 | 0.2059 | |
| RPG-REINFORCE-UFKLContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.136 | 0.1434 | |
| REINFORCE++-BaselineContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.125 | 0.1471 | |
| RPG-REINFORCE-URKLContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.114 | 0.1434 | |
| GRPOContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.1029 | 0.1177 | |
| DAPOContext Length=4k, Base Model=Qwen-2.5-7B-Instruct2025.05 | 0.0993 | 0.1507 |