Reward Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.37Kendall’s Tau
4
Jul 3, 2026
0.356Kendall's Tau
4
Jul 3, 2026
0.39Kendall's τ
4
Jul 3, 2026
1.138MAE
4
Jun 9, 2026
84.82Accuracy
4
Jun 4, 2026
0.231Table MSE
4
Jun 2, 2026
1.103Reward Score Difference (TEA vs GRPO)
4
May 12, 2026
0.467bo1 Score
4
May 12, 2026
2.45Step Completion Rate
4
Mar 19, 2026
3.38Step Completion Rate
4
Mar 19, 2026
2.55Step Completion Rate
4
Mar 19, 2026
2.2Step Completion Rate
4
Mar 19, 2026
1.65Step Completion Rate
4
Mar 19, 2026
57Score
4
Mar 4, 2026
98.3Chat
4
Feb 26, 2026
87.8Accuracy
4
Feb 26, 2026
3.6Score
4
Feb 26, 2026
99.4Chat
4
Feb 26, 2026
80Accuracy
4
Feb 26, 2026
75.5Accuracy
4
Feb 26, 2026
2.73Self-contain Accuracy
3
Jul 2, 2026
0.711RewardBench Total
3
May 19, 2026
591,256Training Samples
3
Apr 9, 2026
340,296Training Samples
3
Apr 9, 2026
53.221Win-Rate
3
Feb 26, 2026