ResearchDatasetsSynthetic ConversationsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsPredicting human judges' overall quality (Q0)Synthetic Conversations (5-fold cross-evaluation)0.611Pearson's r12
Predicting human judges' overall quality (Q0)Synthetic Conversations (5-fold cross-evaluation)0.611Pearson's r12