ResearchDatasetsUFBFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsPreference AlignmentUFB83.2Win Rate32Preference AlignmentUFB (test)81.05Win Rate18Reward Model LearningUFB72.5Win Rate10