ResearchTasksLLM-judge evaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedAXBENCHSPLIT92.5Concept Score22Feb 26, 2026LLM-to-LLM Evaluation Reference: GPT-5.2GPT-5-mini0.84Global Correlation (r)2Mar 16, 2026