Reward Model Evaluation on RewardBench (Accuracy)
93.9AccuracySAVE
Evaluation Results
| Method | Links | |
|---|---|---|
| SAVEPolicy Model=Qwen3-4B-Instruct-2507, Response Generation Method=GRPO2026.05 | 93.9 | |
| SAVEPolicy Model=Qwen2.5-3B-Instruct, Response Generation Method=GRPO2026.05 | 93.6 | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen2.5-3B-Instruct, Response Generation Method=GRPO2026.05 | 93.6 | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen2.5-3B-Instruct, Response Generation Method=GRPO2026.05 | 93.6 | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen3-4B-Instruct-2507, Response Generation Method=GRPO2026.05 | 93.6 | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen3-4B-Instruct-2507, Response Generation Method=GRPO2026.05 | 93.5 | |
| HL-BTPolicy Model=Qwen3-4B-Instruct-2507, Response Generation Method=GRPO2026.05 | 93.3 | |
| HL-BTPolicy Model=Qwen2.5-3B-Instruct, Response Generation Method=GRPO2026.05 | 93.2 | |
| Continual Offline Training RMTraining Data=HuggingFaceH4/ultrafeedback_binarized2026.05 | 93.1 | |
| Skywork-Reward-V2-Llama-3.2-3BDescription=Initial reward model without online updating2026.05 | 93 | |
| Mean RewardPolicy Model=Qwen3-4B-Instruct-2507, Response Generation Method=GRPO2026.05 | 83.4 | |
| Mean RewardPolicy Model=Qwen2.5-3B-Instruct, Response Generation Method=GRPO2026.05 | 83.1 |