ResearchDatasetsSHPFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsHelpfulness EvaluationSHP89Helpfulness Score40LLM AlignmentSHP89.3Diversity15Direct Preference OptimizationSHP AlpacaEval 2.018.44LCWR14Reward MaximizationSHP0.53Win Rate12Binary/Pairwise ClassificationSHP69.5Accuracy9Open-ended DialogueSHP OOD77.5Win Rate4