Reward Modeling Evaluation on RewardBench
88.1R-Bench ScoreSFT + TTL + DPO + TPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT + TTL + DPO + TPOInitialization=SFT + TTL, Method=DPO + TPO2026.05 | 88.1 | |
| SFT + TTL + DPOInitialization=SFT + TTL, Method=DPO2026.05 | 86.8 | |
| SFT (no TTL) + DPOInitialization=SFT (no TTL), Method=DPO2026.05 | 84.5 |