ResearchDatasetsRMBFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReward ModelingRMB89.3Accuracy120Reward ModelingRMB (test)89.3Score22Preference EvaluationRMB Best-of-N86.2Helpfulness Score (BoN)16Reward ModelingRMB88.6Help Accuracy13Best-of-N evaluationRMB59.69Accuracy2