ResearchTasksLLM Judging AgreementFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedReasoning Agreement Benchmark 500-sample human-annotatedMulti-sub RM0.91Cohen's Kappa15Jun 12, 2026Reasoning Agreement Benchmark 2,500 samplesGPT-4o100Parsing Success Rate15Jun 12, 2026