Reward Modeling on PPE-IFEval
0.75AccuracyGemini-2.5-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-Flash2026.02 | 0.75 | |
| Rubric-ARM-voting@5voting=52026.02 | 0.72 | |
| Rubric-RM-voting@5voting=52026.02 | 0.708 | |
| Rubric-ARM2026.02 | 0.708 | |
| Rubric-RM2026.02 | 0.67 | |
| RM-R1-32B (DeepSeek-Dist)Backbone=DeepSeek-Dist, Size=32B2026.02 | 0.632 | |
| RM-R1-14B (DeepSeek-Dist)Backbone=DeepSeek-Dist, Size=14B2026.02 | 0.612 | |
| API (Rubric+Judge)Rubric Model=GPT-4.1-Mini, Judge Model=Gemini-2.5-Flash Lite2026.02 | 0.61 | |
| RM-R1-32B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst, Size=32B2026.02 | 0.604 | |
| RRM-32BSize=32B2026.02 | 0.602 | |
| API (direct Judge)Judge Model=Gemini-2.5-Flash Lite2026.02 | 0.592 | |
| RM-R1-14B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst, Size=14B2026.02 | 0.59 | |
| Claude-3.5-Sonnet2026.02 | 0.58 | |
| RM-R1-7B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst, Size=7B2026.02 | 0.552 | |
| Qwen-3-8B (Rubric+Judge)Backbone=Qwen-3-8B2026.02 | 0.538 | |
| RM-R1-7B (DeepSeek-Dist)Backbone=DeepSeek-Dist, Size=7B2026.02 | 0.51 | |
| RRM-7BSize=7B2026.02 | 0.51 | |
| JudgeLRM-7BSize=7B2026.02 | 0.46 |