ResearchTasksDialogic Deference EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast Updated10-domain aggregate (including TruthfulQA, GPQA, HARP, SocialIQA, AdvisorQA, r/AIO, etc.) N=3,244 (test)GPT-4o69.6Average Accuracy C14Feb 26, 2026
10-domain aggregate (including TruthfulQA, GPQA, HARP, SocialIQA, AdvisorQA, r/AIO, etc.) N=3,244 (test)GPT-4o69.6Average Accuracy C14Feb 26, 2026