Reward Modeling on RewardBench mathprm
72.5Scoregpt-4o-2024-05-13
Evaluation Results
| Method | Links | |
|---|---|---|
| gpt-4o-2024-05-13Source=RewardBench leaderboard2026.03 | 72.5 | |
| CoVerRLbackbone=Llama-3.2-3B-Instruct2026.03 | 70 | |
| gpt-4-turbo-2024-04-09Source=RewardBench leaderboard2026.03 | 67.3 | |
| Meta-Llama-3-70B-InstructSource=RewardBench leaderboard2026.03 | 66.2 | |
| CoVerRLbackbone=Qwen2.5-7B2026.03 | 60.9 | |
| Llama-3.2-3B-Instruct2026.03 | 58.6 | |
| CoVerRLbackbone=Qwen3-1.7B-Base2026.03 | 56.4 | |
| Qwen2.5-7B2026.03 | 49.7 | |
| Qwen3-1.7B-Base2026.03 | 46.8 |