ResearchDatasetsM-JudgeBenchFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMLLM-as-a-judge evaluationM-JudgeBench67.45Pairwise CoT Accuracy10