Reward Modeling on PPE-P
68.3AccuracyDeepSeek-BTRM-27B
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-BTRM-27BModel=DeepSeek-BTRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 68.3 | |
| GPT-4oModel=GPT-4o, Source (Reported vs. Reproduced)=Reported2026.02 | 67.1 | |
| CLoud-Gemma-2-27BModel=CLoud-Gemma-2-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 67.1 | |
| Gemini-1.5-ProModel=Gemini-1.5-Pro, Source (Reported vs. Reproduced)=Reported2026.02 | 66.1 | |
| DeepSeek-PairRM-27BModel=DeepSeek-PairRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 65.8 | |
| LLaMA-3.1-70b-InstructModel=LLaMA-3.1-70b-Instruct, Source (Reported vs. Reproduced)=Reported2026.02 | 65.3 | |
| Claude-3.5-sonnetModel=Claude-3.5-sonnet, Source (Reported vs. Reproduced)=Reported2026.02 | 65.3 | |
| OPRM-RgFT-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 65.3 | |
| OPRM-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 65.1 | |
| DeepSeek-GRM-27BModel=DeepSeek-GRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 64.7 | |
| OPRM-RgFT-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 64.6 | |
| LLM-as-a-JudgeModel=LLM-as-a-Judge, Source (Reported vs. Reproduced)=Reproduced2026.02 | 64.2 | |
| DeepSeek-GRM-27B-RFTModel=DeepSeek-GRM-27B-RFT, Source (Reported vs. Reproduced)=Reproduced2026.02 | 64.1 | |
| OPRM-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 63.9 | |
| OPRM-RgFT-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 63.4 | |
| OPRM-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 63 | |
| DeepSeek-V2.5-0905Model=DeepSeek-V2.5-0905, Source (Reported vs. Reproduced)=Reported2026.02 | 62.8 | |
| OPRM-RgFT-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 62.3 | |
| OPRM-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 61.1 | |
| InternLM2-20B-RewardModel=InternLM2-20B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 61 | |
| ArmoRM-8B-v0.1Model=ArmoRM-8B-v0.1, Source (Reported vs. Reproduced)=Reported2026.02 | 60.6 | |
| Nemotron-4-340B-RewardModel=Nemotron-4-340B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 59.3 | |
| Skywork-Reward-Gemma-2-27BModel=Skywork-Reward-Gemma-2-27B, Source (Reported vs. Reproduced)=Reported2026.02 | 56.6 |