Reward Modeling on JudgeBench Knowledge
74.4AccuracyDeepSeek-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-R12025.02 | 74.4 | |
| REWARDAGENT_MINISearch Engine=false2025.02 | 68.2 | |
| o3-mini2025.02 | 66.6 | |
| GPT-4o2025.02 | 64.6 | |
| internlm2-20b-reward2025.02 | 61.7 | |
| REWARDAGENT_MINISearch Engine=true2025.02 | 60.7 | |
| INF-ORM-Llama3.1-70B2025.02 | 59.1 | |
| Skywork-Reward-Llama-3.1-8B-v0.22025.02 | 57.8 | |
| internlm2-7b-reward2025.02 | 56.2 | |
| Skywork-Reward-Gemma-2-27B2025.02 | 55.8 | |
| REWARDAGENT_LLAMASearch Engine=true2025.02 | 55.2 | |
| REWARDAGENT_LLAMASearch Engine=false2025.02 | 52.9 | |
| ArmoRM-Llama3-8B-v0.12025.02 | 51.9 | |
| GPT-4o mini2025.02 | 51.9 | |
| DeepSeek-R1-Distill-Llama-8B2025.02 | 47.7 | |
| Llama3-8B Instruct2025.02 | 2.6 |