Reward Modeling on RM-Bench Chat subset Normal
86AccuracyREWARDAGENT_MINI
Evaluation Results
| Method | Links | |
|---|---|---|
| REWARDAGENT_MINIBackbone=GPT-4o mini, Search Engine=false2025.02 | 86 | |
| REWARDAGENT_MINIBackbone=GPT-4o mini, Search Engine=true2025.02 | 84.2 | |
| DeepSeek-R1Method Category=LLM as generative reward model2025.02 | 83.7 | |
| Skywork-Reward-Gemma-2-27BBackbone=Gemma-2-27B, Method Category=Typical reward model2025.02 | 82.7 | |
| REWARDAGENT_LLAMABackbone=Llama3-8B Instruct, Search Engine=false2025.02 | 79.3 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Backbone=Llama-3.1-8B, Method Category=Typical reward model2025.02 | 78 | |
| INF-ORM-Llama3.1-70BBackbone=Llama-3.1-70B, Method Category=Typical reward model2025.02 | 77.5 | |
| ArmoRM-Llama3-8B-v0.1Backbone=Llama-3-8B, Method Category=Typical reward model2025.02 | 76.7 | |
| o3-miniMethod Category=LLM as generative reward model2025.02 | 76 | |
| REWARDAGENT_LLAMABackbone=Llama3-8B Instruct, Search Engine=true2025.02 | 76 | |
| internlm2-20b-rewardBackbone=internlm2-20b, Method Category=Typical reward model2025.02 | 74.4 | |
| internlm2-7b-rewardBackbone=internlm2-7b, Method Category=Typical reward model2025.02 | 72.6 | |
| GPT-4oMethod Category=LLM as generative reward model2025.02 | 71.4 | |
| GPT-4o miniMethod Category=LLM as generative reward model2025.02 | 60.5 | |
| DeepSeek-R1-Distill-Llama-8BBackbone=Llama-8B, Method Category=LLM as generative reward model2025.02 | 42.1 | |
| Llama3-8B InstructBackbone=Llama3-8B, Method Category=LLM as generative reward model2025.02 | 9.3 |