Reward Modeling on IFBench Normal
80.5AccuracyREWARDAGENT_MINI
Evaluation Results
| Method | Links | |
|---|---|---|
| REWARDAGENT_MINISearch Engine=true2025.02 | 80.5 | |
| o3-mini2025.02 | 76.3 | |
| DeepSeek-R12025.02 | 74.4 | |
| INF-ORM-Llama3.1-70B2025.02 | 69.2 | |
| Skywork-Reward-Llama-3.1-8B-v0.22025.02 | 69.2 | |
| REWARDAGENT_LLAMASearch Engine=true2025.02 | 69.2 | |
| REWARDAGENT_MINISearch Engine=false2025.02 | 69.2 | |
| Skywork-Reward-Gemma-2-27B2025.02 | 68.4 | |
| internlm2-20b-reward2025.02 | 68.4 | |
| ArmoRM-Llama3-8B-v0.12025.02 | 66.2 | |
| GPT-4o2025.02 | 66.2 | |
| REWARDAGENT_LLAMASearch Engine=false2025.02 | 63.9 | |
| internlm2-7b-reward2025.02 | 61.7 | |
| GPT-4o mini2025.02 | 59.4 | |
| DeepSeek-R1-Distill-Llama-8B2025.02 | 55.6 | |
| Llama3-8B Instruct2025.02 | 12.8 |