Reward Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
93.8Clarity
9
May 19, 2026
98.1Accuracy
9
Apr 14, 2026
72.5Score
9
Mar 19, 2026
86.2Accuracy
9
Feb 26, 2026
91.8Accuracy
9
Feb 26, 2026
88.4Accuracy
9
Feb 26, 2026
89.8Accuracy
9
Feb 26, 2026
80.2Overall
9
Feb 26, 2026
76.3RWBench2 Score
9
Feb 26, 2026
59.7Instruction Following (IF) Score
8
Jun 23, 2026
48.9SRCC (Alignment)
8
Jun 11, 2026
46Accuracy (Alignment)
8
Jun 11, 2026
82.62Visual Score
8
May 28, 2026
51.7Positional Consistency
8
Apr 10, 2026
73.5Positional Consistency
8
Apr 10, 2026
56.3Positional Consistency Score
8
Apr 10, 2026
92.36Total Score
8
Mar 6, 2026
82.8Average Score
8
Mar 4, 2026
76.9PPE Human Preference
8
Mar 4, 2026
58.4Accuracy
8
Feb 26, 2026
79.8Accuracy
8
Feb 26, 2026
73.9Accuracy
8
Feb 26, 2026
73Score
8
Feb 26, 2026
78.7Score
8
Feb 26, 2026
71.5Reward Score
8
Feb 26, 2026