Reward Modeling on PPE Correctness
71.2AccuracySAVE
Evaluation Results
| Method | Links | |
|---|---|---|
| SAVEPolicy Model=Qwen3-4B-Instruct-25072026.05 | 71.2 | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen3-4B-Instruct-25072026.05 | 71.2 | |
| SAVEPolicy Model=Qwen2.5-3B-Instruct2026.05 | 71.1 | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen3-4B-Instruct-25072026.05 | 71.1 | |
| Continual Offline Training RM2026.05 | 71 | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen2.5-3B-Instruct2026.05 | 71 | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen2.5-3B-Instruct2026.05 | 70.9 | |
| Skywork-Reward-V2-Llama-3.2-3B2026.05 | 70.7 | |
| HL-BTPolicy Model=Qwen2.5-3B-Instruct2026.05 | 70.5 | |
| HL-BTPolicy Model=Qwen3-4B-Instruct-25072026.05 | 70.5 | |
| OPRM-RgFT-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 67.3 | |
| DeepSeek-BTRM-27BModel=DeepSeek-BTRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 66.7 | |
| Mean RewardPolicy Model=Qwen3-4B-Instruct-25072026.05 | 66.6 | |
| OPRM-RgFT-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 66.4 | |
| OPRM-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 66.1 | |
| Mean RewardPolicy Model=Qwen2.5-3B-Instruct2026.05 | 65.9 | |
| WILDREWARD-8BSize=8B2026.02 | 65.6 | |
| OPRM-RgFT-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 65.6 | |
| DeepSeek-PairRM-27BModel=DeepSeek-PairRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 64.8 | |
| INF-ORM-Llama3.1-70BBackbone=Llama3.1-70B2026.02 | 64.4 | |
| OPRM-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 64.3 | |
| OPRM-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 64.3 | |
| Llama-3-OffsetBias-RM-8BSize=8B2026.02 | 64.1 | |
| WILDREWARD-4BSize=4B2026.02 | 63.6 | |
| Llama-3.1-Nemotron-70BSize=70B2026.02 | 63.2 | |
| Internlm2-20b-rewardSize=20b2026.02 | 63 | |
| InternLM2-20B-RewardModel=InternLM2-20B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 63 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Backbone=Llama-3.1-8B2026.02 | 62.5 | |
| CLoud-Gemma-2-27BModel=CLoud-Gemma-2-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 62.4 | |
| OPRM-RgFT-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 62.4 | |
| Athene-RM-8BSize=8B2026.02 | 62 | |
| Skywork-Reward-Gemma-2-27B-v0.2Backbone=Gemma-2-27B2026.02 | 61.9 | |
| OPRM-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 61.3 | |
| ArmoRM-8B-v0.1Model=ArmoRM-8B-v0.1, Source (Reported vs. Reproduced)=Reported2026.02 | 61.2 | |
| Nemotron-4-340B-RewardModel=Nemotron-4-340B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 60.8 | |
| ArmoRM-Llama3-8B-v0.1Backbone=Llama3-8B2026.02 | 60.6 | |
| Gemini-1.5-ProModel=Gemini-1.5-Pro, Source (Reported vs. Reproduced)=Reported2026.02 | 59.8 | |
| DeepSeek-GRM-27BModel=DeepSeek-GRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 59.8 | |
| DeepSeek-GRM-27B-RFTModel=DeepSeek-GRM-27B-RFT, Source (Reported vs. Reproduced)=Reproduced2026.02 | 59.6 | |
| LLaMA-3.1-70b-InstructModel=LLaMA-3.1-70b-Instruct, Source (Reported vs. Reproduced)=Reported2026.02 | 59.2 | |
| Claude-3.5-sonnetModel=Claude-3.5-sonnet, Source (Reported vs. Reproduced)=Reported2026.02 | 58.8 | |
| LLM-as-a-JudgeModel=LLM-as-a-Judge, Source (Reported vs. Reproduced)=Reproduced2026.02 | 58.8 | |
| DeepSeek-V2.5-0905Model=DeepSeek-V2.5-0905, Source (Reported vs. Reproduced)=Reported2026.02 | 58.5 | |
| GPT-4oModel=GPT-4o, Source (Reported vs. Reproduced)=Reported2026.02 | 57.6 | |
| Skywork-Reward-Gemma-2-27BModel=Skywork-Reward-Gemma-2-27B, Source (Reported vs. Reproduced)=Reported2026.02 | 56.6 |