Reward Modeling on PPE
76.4AccuracyGemini-3-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3-Flash2026.03 | 76.4 | |
| DeepSeek-V3.22026.03 | 69 | |
| Mix-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 64.8 | |
| Base-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 64 | |
| FARE-8BStage=SFT, Data=2.5M2026.03 | 62.5 | |
| RubricRM-8BStage=SFT, Data=36K2026.03 | 62.5 | |
| Mix-GRMStage=SFT, Data=9K2026.03 | 62.1 | |
| RM-R1-7B (Distill)Stage=SFT, RL, Data=9K, 64K2026.03 | 62 | |
| RM-R1-7B (Instruct)Stage=SFT, RL, Data=9K, 64K2026.03 | 62 | |
| Skywork-Reward-8BStage=BT, Data=44K2026.03 | 61.7 | |
| Base-GRMStage=SFT, Data=9K2026.03 | 61.1 | |
| DeepSeek-GRM-16BStage=SFT, RL, Data=1.2M, 237K2026.03 | 59.1 | |
| JudgeLRM-7BStage=RL, Data=100K2026.03 | 57.9 |