ResearchDatasetsRoleChatFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsRole-playing Dialogue EvaluationRoleChat gold-standard evaluation set96.6Logical Coherence10Role-playing EvaluationRoleChat (val)0.21Overall MSE5Role-playing Quality EvaluationRoleChat (Human Evaluation)87Win Rate2