ResearchDatasetsStanford SHPFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsPreference-based AlignmentStanford SHP (test)83.5Win Rate (Llama)9